跳到正文
10月8日周四
  1. Microsoft Research67

    Agent Lightning v1.0 发布:3500 行轻量智能体 RL 框架,支持真实 harness 训练

    微软亚洲研究院开源 Agent Lightning v1.0,这是一个约 3500 行代码的轻量级智能体 RL 框架,采用 Harnessed Agentic RL 范式,实现部署用 harness 直接参与强化学习训练而无需在训练框架内重写 agent。

    推荐理由:Agent Lightning v1.0 不到 3500 行实现完整智能体 RL 系统,读者可了解如何在真实 harness 上训练 agent。

10月7日周三
  1. Microsoft Research19

    Microsoft 研究:AI 在传统基准之外为何会「意外失败」

    Microsoft 的 Jennifer Neville 在 Microsoft Research Podcast 中讨论评估如何推动 AI 系统性能边界,以及在传统基准之外测试模型时出现的「意外失败」。她结合自己从数学、物理、认知科学到计算机科学的经历,分享使用当前 AI 系统的实用建议,并强调结果超出预期时应仔细审视数据。

10月5日周一
10月4日周日
  1. Hugging Face Blog69

    微软发布 ThinkingBox:用数据库终态而非自述评判 AI 智能体

    微软与 Hugging Face 联合发布 ThinkingBox,通过隔离 MCP 会话检查智能体留下的后端状态与副作用,而不是看它生成的文字,Bench 覆盖 507 个有状态业务流程、每个任务重复运行 20 次。

    推荐理由:微软与 Hugging Face 联合发布的智能体基准,用后端数据库终态而非模型自述来判定成败,并公开了 507 个任务、20 次重复运行的完整环境。

10月1日周四
  1. Microsoft Research37

    微软研究院用机器学习预测电网空间天气风险

    微软研究院实习生构建的机器学习流水线,利用 L1 太阳风观测、AE 与 Dst 指数预报、地质电导率及电网数据,为美国本土 66,935 座变电站生成 30-60 分钟前的点位级地磁感应电流风险估计。2020-2026 评估期内,该系统对主要空间天气事件检出率近 80%,Dst 预测在 62.2% 的高活跃时段优于 Burton 方程。

9月29日周二
  1. Microsoft Research70

    微软研究院发布面向生物学复杂性的 AI 研究系统 Quine

    微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,由生物学多模态世界模型和连接科学工具、文献、湿实验与研究者的交互 harness 组成。它与 Broad Institute 合作,用该系统筛选可能驱动肿瘤状态转变的化合物,最高排名化合物在多个湿实验检测中产生了最大的目标转变,整个过程从缩小化合物搜索空间到选出候选仅用一个周末。

    推荐理由:微软研究院公开生物学多模态世界模型 Quine 的构建思路,并给出胰腺癌化合物筛选的湿实验验证细节。

  2. Microsoft Research13

    微软亚洲研究院新加坡成立一周年:推进科研、合作与人才培养

    微软亚洲研究院新加坡(MSRA – Singapore)作为微软在东南亚的首个研究实验室,成立一年来聚焦下一代 AI 模型与智能体系统、领域专用 AI、AI 原生研究实践及生态与人才培养四大方向。该实验室与新加坡医疗生态伙伴合作探索多模态医疗 AI 和自演化诊断智能体,并与经济发展局(EDB)等机构推进产学研协作。

9月26日周六
  1. GitHub Blog · AI & ML39

    GitHub Copilot 应用入门:如何用 canvases 构建自定义工作流

    GitHub Copilot 应用中的 canvas 是一种可定制界面,通过 /create-canvas 技能用自然语言描述即可生成看板、清单或仪表盘。canvas 具备双向同步能力,你和智能体可同时修改并在界面中即时看到更新,生成的 canvas 会保存为扩展供团队共享或个人复用。Awesome Copilot 还提供了发布说明、看板、issue 分诊等现成 canvas 扩展。

9月24日周四
  1. GitHub Blog · AI & ML29

    GitHub Copilot 应用如何渲染超大 pull request

    GitHub Copilot 应用重建了 pull request 视图,用一个 2,200 个文件、超百万行改动、400 多条行内评论的开源 PR 做压力测试。其做法是拆分两套几何:代码行高在绘制前精确已知、永不重建;评论、草稿和回复框等动态块惰性测量,修正幅度小且锚定在用户当前查看的位置。

  2. Microsoft Research63

    微软研究院研究物理 AI 机器人推理卸载并推出 Physical AI Toolchain 新能力

    微软研究院发布机器人物理 AI 推理卸载的测量研究,发现将推理完全放在机器人端侧 GPU 会限制性能、续航与可扩展性,而卸载到边缘或云端 GPU 在移动操作任务中可提升成功率、支持更大模型并显著改善电池寿命。

    推荐理由:微软研究院系统测量了机器人端侧推理的限制,并给出 Kubernetes 卸载方案,可迁移到具身智能部署。

9月21日周一