跳到正文
10月9日周五
  1. Hugging Face Blog34

    Ai2 如何用 GPU 时间预算与分层公平分配改进集群调度

    Ai2 用 GPU 时间预算、分层公平分配和时间切片契约替换了原有的优先级调度器,把"哪个项目该拿多少 GPU 时间"从事后逐个协调变成透明的预算流程。Ai2 管理数千块 NVIDIA H100、B200 和 B300,集群规模 88 到 1024 块 GPU,服务约 150 名内部研究者,待处理需求常达可用 GPU 的 2-3 倍。

10月8日周四
  1. Microsoft Research67

    Agent Lightning v1.0 发布:3500 行轻量智能体 RL 框架,支持真实 harness 训练

    微软亚洲研究院开源 Agent Lightning v1.0,这是一个约 3500 行代码的轻量级智能体 RL 框架,采用 Harnessed Agentic RL 范式,实现部署用 harness 直接参与强化学习训练而无需在训练框架内重写 agent。

    推荐理由:Agent Lightning v1.0 不到 3500 行实现完整智能体 RL 系统,读者可了解如何在真实 harness 上训练 agent。

10月7日周三
  1. AWS Machine Learning Blog27

    超越节省工时:如何为 agentic automation 构建商业论证

    AWS 提出 Agentic Value Model,认为以“节省工时×人力成本”衡量自动化的传统 ROI 模型是为 RPA 设计的,会漏掉 AI 智能体的大部分价值。该框架从时间节省、异常处理、决策质量和变更韧性四个维度衡量价值,并以价值实现机制作为前提;文中称修正一个错误可能花费原交易成本的 1.5–4 倍,人为错误可占运营成本的 2–15%。

  2. Google DeepMind71

    Google DeepMind 发布 EmbeddingGemma 2,轻量开源多模态嵌入模型

    Google DeepMind 发布 EmbeddingGemma 2,这是基于 Gemma 4 架构、采用 Apache 2.0 许可的开源多模态嵌入模型,可将文本、图像、音频、视频映射到统一嵌入空间。

    推荐理由:Google DeepMind 开源 740M 参数多模态嵌入模型,给出端侧内存占用与向量截断方法,可供本地检索与 RAG 选型参考。

  3. Microsoft Research19

    Microsoft 研究:AI 在传统基准之外为何会「意外失败」

    Microsoft 的 Jennifer Neville 在 Microsoft Research Podcast 中讨论评估如何推动 AI 系统性能边界,以及在传统基准之外测试模型时出现的「意外失败」。她结合自己从数学、物理、认知科学到计算机科学的经历,分享使用当前 AI 系统的实用建议,并强调结果超出预期时应仔细审视数据。

10月6日周二
  1. Mistral AI84

    Mistral 发布 Mistral Large 4 公开预览,1 万亿参数多模态模型

    Mistral AI 发布 Mistral Large 4 公开预览,可通过 Mistral Studio 试用预览 API,权重计划于本月底开放。ML4 是 1 万亿参数、52B 激活参数的原生多模态模型,在欧洲自有数据中心的 3,800 块 NVIDIA Grace Blackwell GPU 上从零训练,官方称其在编码、智能体工作流和多模态理解上可与最强开源模型竞争。

    推荐理由:官方给出 1 万亿参数、52B 激活的开放权重模型细节与多类基准对比,可据此判断开源前沿模型的能力位置。

10月5日周一
10月4日周日
  1. Hugging Face Blog69

    微软发布 ThinkingBox:用数据库终态而非自述评判 AI 智能体

    微软与 Hugging Face 联合发布 ThinkingBox,通过隔离 MCP 会话检查智能体留下的后端状态与副作用,而不是看它生成的文字,Bench 覆盖 507 个有状态业务流程、每个任务重复运行 20 次。

    推荐理由:微软与 Hugging Face 联合发布的智能体基准,用后端数据库终态而非模型自述来判定成败,并公开了 507 个任务、20 次重复运行的完整环境。

10月2日周五
  1. GitHub Blog · AI & ML21

    AI 正在改变开发者工作方式,GitHub 给出三项值得强化的技能

    GitHub 提出 AI 时代开发者应强化的三项技能:学会指挥 AI 智能体而非仅使用 AI、不轻信 AI 的第一次回答、用 AI 节省的时间解决更大问题。文中举例称 GitHub Copilot 内置的 Rubber Duck agent 会用第二个模型审查计划、代码与测试;在认证流程示例中,开发者可同时协调三个 AI 智能体分别产出认证、文档和测试。

  2. Google Research63

    Google 发布基于 TEE 的可验证隐私联邦学习系统

    Google Research 发布新一代联邦学习系统,利用可信执行环境(TEE)为数据匿名化提供可验证、可审计的保证,并已应用于 Gboard。系统中,客户端设备本地加密训练数据并上传,只有符合访问策略的 TEE 工作负载才能解密处理,访问策略发布到公开透明日志 Rekor,相关二进制可从开源仓库 Confidential Federated Compute 复现构建。

    推荐理由:Google 公布基于 TEE 的新一代联邦学习系统设计,读者可了解其如何让服务端处理过程可外部验证。

  3. Hugging Face Blog45

    AutoSynthData:为企业级智能体生成训练数据

    ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例和更强教师的成功案例,定位当前模型的能力缺口,并据此生成、验证新的可执行训练任务。管线以 EnterpriseOps Gym 数据集为例演示,任务由系统规范、用户提示词和验证器三部分组成,需满足可行性、真实性与难度要求。随着模型改进,课程会自动转向其仍未掌握的能力。

10月1日周四
  1. Google DeepMind73

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御者开放,随后逐步向开发者、企业和消费者推出。

    推荐理由:原文给出 Argon 在编码与网络安全防御上的基准成绩和 Google 内部落地案例,读者可据此判断前沿模型的能力边界。