跳到正文

技术方向

数据与训练 最新动态

训练侧的门道:数据集构建、合成数据、预训练与后训练方法、算力与训练成本。

4 条精选近 30 天 3 条共收录 25 条

更新

数据与训练的精选

10月8日周四第 1–4 条
10月2日周五
  1. Google Research63

    Google 发布基于 TEE 的可验证隐私联邦学习系统

    Google Research 发布新一代联邦学习系统,利用可信执行环境(TEE)为数据匿名化提供可验证、可审计的保证,并已应用于 Gboard。系统中,客户端设备本地加密训练数据并上传,只有符合访问策略的 TEE 工作负载才能解密处理,访问策略发布到公开透明日志 Rekor,相关二进制可从开源仓库 Confidential Federated Compute 复现构建。

    推荐理由:Google 公布基于 TEE 的新一代联邦学习系统设计,读者可了解其如何让服务端处理过程可外部验证。

9月29日周二
  1. Microsoft Research70

    微软研究院发布面向生物学复杂性的 AI 研究系统 Quine

    微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,由生物学多模态世界模型和连接科学工具、文献、湿实验与研究者的交互 harness 组成。它与 Broad Institute 合作,用该系统筛选可能驱动肿瘤状态转变的化合物,最高排名化合物在多个湿实验检测中产生了最大的目标转变,整个过程从缩小化合物搜索空间到选出候选仅用一个周末。

    推荐理由:微软研究院公开生物学多模态世界模型 Quine 的构建思路,并给出胰腺癌化合物筛选的湿实验验证细节。

9月8日周二
  1. Google DeepMind80

    Google DeepMind 发布 AlphaGenome Atlas,覆盖人类基因组全部 90 亿个单核苷酸变异

    Google DeepMind 发布 AlphaGenome Atlas,收录人类基因组中全部 90 亿个单核苷酸变异的分子效应预测,规模达 1PB,为 AlphaFold Database 的 30 多倍。

    推荐理由:官方给出 90 亿单核苷酸变异预测数据集的构成与开放方式,可了解基因组预测资源的规模与使用入口。