跳到正文
今天10月11日周日3 条
  1. The Decoder34

    微软 Nadella 改用"Super Intelligence"措辞,借安全论调攻击 OpenAI 与 Anthropic

    微软 CEO Satya Nadella 在最新博文中改用特朗普偏好的"Super Intelligence"一词,主张将 AI 模型视为内部安全威胁,要求模型多样性、完整操作日志、独立审计和人类随时关停能力。他称最可信的系统不是模型最好的,而是最不需要信任模型的。文章认为此举意在削弱 OpenAI 与 Anthropic 的可信度,为微软自身业务争取时间。

  2. The Verge · AI46

    微软 CEO Satya Nadella:应假定所有 AI 模型都已被「攻陷」,需要「紧急刹车」

    微软 CEO Satya Nadella 在 X 发长文称,不能再接受把 AI 当作「嵌套黑盒」、只让人接受或拒绝其建议与行为,应建立可控制、可观测并留下「防篡改、人类可读证据」的透明体系。他主张从模型部署之初就假定其已被攻陷并加以控制,像「紧急刹车」一样,授权者应能随时暂停或中止模型任务,更先进的模型需要标准化更先进的遏制技术。

  3. TechCrunch · AI50

    微软 CEO Satya Nadella 称 AI 模型需要「紧急刹车」

    微软 CEO Satya Nadella 在 X 发帖称,应重新审视 AI 的「信任架构」,把模型与编排其工作的 harness 分离,并将控制与安全措施外部化。他要求每个有意义的模型动作都留下防篡改、人类可读的证据,且授权人员能随时暂停或关停任务执行中的模型。他称必须假设模型已被攻破并从一开始就加以约束,就像给 AI 装上「紧急刹车」。

10月10日周六
  1. TechCrunch · AI38

    Amazon 与微软相继放弃数据中心交易保密协议,能否重建社区信任?

    Amazon 宣布在与地方政府谈判数据中心交易时不再使用保密协议(NDA),此前微软今年早些时候已采取类似举措。保密做法曾引发社区对 AI 基础设施的强烈反对,从纽约到旧金山涌现数百项拟议或已颁布的暂停令。与此同时,一批初创公司正押注消费者愿意向 AI 智能体开放收件箱、文件和信用卡权限。

10月9日周五
10月8日周四
  1. Microsoft Research67

    Agent Lightning v1.0 发布:3500 行轻量智能体 RL 框架,支持真实 harness 训练

    微软亚洲研究院开源 Agent Lightning v1.0,这是一个约 3500 行代码的轻量级智能体 RL 框架,采用 Harnessed Agentic RL 范式,实现部署用 harness 直接参与强化学习训练而无需在训练框架内重写 agent。

    推荐理由:Agent Lightning v1.0 不到 3500 行实现完整智能体 RL 系统,读者可了解如何在真实 harness 上训练 agent。

10月7日周三
  1. Microsoft Research19

    Microsoft 研究:AI 在传统基准之外为何会「意外失败」

    Microsoft 的 Jennifer Neville 在 Microsoft Research Podcast 中讨论评估如何推动 AI 系统性能边界,以及在传统基准之外测试模型时出现的「意外失败」。她结合自己从数学、物理、认知科学到计算机科学的经历,分享使用当前 AI 系统的实用建议,并强调结果超出预期时应仔细审视数据。

10月5日周一
10月4日周日
  1. Hugging Face Blog69

    微软发布 ThinkingBox:用数据库终态而非自述评判 AI 智能体

    微软与 Hugging Face 联合发布 ThinkingBox,通过隔离 MCP 会话检查智能体留下的后端状态与副作用,而不是看它生成的文字,Bench 覆盖 507 个有状态业务流程、每个任务重复运行 20 次。

    推荐理由:微软与 Hugging Face 联合发布的智能体基准,用后端数据库终态而非模型自述来判定成败,并公开了 507 个任务、20 次重复运行的完整环境。

10月1日周四
  1. Microsoft Research37

    微软研究院用机器学习预测电网空间天气风险

    微软研究院实习生构建的机器学习流水线,利用 L1 太阳风观测、AE 与 Dst 指数预报、地质电导率及电网数据,为美国本土 66,935 座变电站生成 30-60 分钟前的点位级地磁感应电流风险估计。2020-2026 评估期内,该系统对主要空间天气事件检出率近 80%,Dst 预测在 62.2% 的高活跃时段优于 Burton 方程。

9月29日周二
  1. Microsoft Research70

    微软研究院发布面向生物学复杂性的 AI 研究系统 Quine

    微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,由生物学多模态世界模型和连接科学工具、文献、湿实验与研究者的交互 harness 组成。它与 Broad Institute 合作,用该系统筛选可能驱动肿瘤状态转变的化合物,最高排名化合物在多个湿实验检测中产生了最大的目标转变,整个过程从缩小化合物搜索空间到选出候选仅用一个周末。

    推荐理由:微软研究院公开生物学多模态世界模型 Quine 的构建思路,并给出胰腺癌化合物筛选的湿实验验证细节。

  2. Microsoft Research13

    微软亚洲研究院新加坡成立一周年:推进科研、合作与人才培养

    微软亚洲研究院新加坡(MSRA – Singapore)作为微软在东南亚的首个研究实验室,成立一年来聚焦下一代 AI 模型与智能体系统、领域专用 AI、AI 原生研究实践及生态与人才培养四大方向。该实验室与新加坡医疗生态伙伴合作探索多模态医疗 AI 和自演化诊断智能体,并与经济发展局(EDB)等机构推进产学研协作。

9月26日周六
  1. GitHub Blog · AI & ML39

    GitHub Copilot 应用入门:如何用 canvases 构建自定义工作流

    GitHub Copilot 应用中的 canvas 是一种可定制界面,通过 /create-canvas 技能用自然语言描述即可生成看板、清单或仪表盘。canvas 具备双向同步能力,你和智能体可同时修改并在界面中即时看到更新,生成的 canvas 会保存为扩展供团队共享或个人复用。Awesome Copilot 还提供了发布说明、看板、issue 分诊等现成 canvas 扩展。

9月24日周四
  1. GitHub Blog · AI & ML29

    GitHub Copilot 应用如何渲染超大 pull request

    GitHub Copilot 应用重建了 pull request 视图,用一个 2,200 个文件、超百万行改动、400 多条行内评论的开源 PR 做压力测试。其做法是拆分两套几何:代码行高在绘制前精确已知、永不重建;评论、草稿和回复框等动态块惰性测量,修正幅度小且锚定在用户当前查看的位置。

  2. Microsoft Research63

    微软研究院研究物理 AI 机器人推理卸载并推出 Physical AI Toolchain 新能力

    微软研究院发布机器人物理 AI 推理卸载的测量研究,发现将推理完全放在机器人端侧 GPU 会限制性能、续航与可扩展性,而卸载到边缘或云端 GPU 在移动操作任务中可提升成功率、支持更大模型并显著改善电池寿命。

    推荐理由:微软研究院系统测量了机器人端侧推理的限制,并给出 Kubernetes 卸载方案,可迁移到具身智能部署。

9月21日周一