跳到正文
10月10日周六
10月7日周三
10月6日周二
10月5日周一
  1. MIT Technology Review · AI26

    如何将 AI 智能体接入企业知识

    MIT Technology Review 基于 300 名数据与 AI 高管的调研发现,企业平均仅约 34% 的智能体 AI 项目能进入生产环境,知识匮乏是关键卡点。生产领先者(平均 61% 项目走出试点)在语义等知识能力上更强。数据碎片化被 55% 受访者列为扩展智能体知识访问的首要挑战,企业将优先投资检索管线、AI-ready API、RAG 与知识图谱。

10月4日周日
  1. Hugging Face Blog69

    微软发布 ThinkingBox:用数据库终态而非自述评判 AI 智能体

    微软与 Hugging Face 联合发布 ThinkingBox,通过隔离 MCP 会话检查智能体留下的后端状态与副作用,而不是看它生成的文字,Bench 覆盖 507 个有状态业务流程、每个任务重复运行 20 次。

    推荐理由:微软与 Hugging Face 联合发布的智能体基准,用后端数据库终态而非模型自述来判定成败,并公开了 507 个任务、20 次重复运行的完整环境。

10月2日周五
  1. Google Research63

    Google 发布基于 TEE 的可验证隐私联邦学习系统

    Google Research 发布新一代联邦学习系统,利用可信执行环境(TEE)为数据匿名化提供可验证、可审计的保证,并已应用于 Gboard。系统中,客户端设备本地加密训练数据并上传,只有符合访问策略的 TEE 工作负载才能解密处理,访问策略发布到公开透明日志 Rekor,相关二进制可从开源仓库 Confidential Federated Compute 复现构建。

    推荐理由:Google 公布基于 TEE 的新一代联邦学习系统设计,读者可了解其如何让服务端处理过程可外部验证。

  2. Hugging Face Blog45

    AutoSynthData:为企业级智能体生成训练数据

    ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例和更强教师的成功案例,定位当前模型的能力缺口,并据此生成、验证新的可执行训练任务。管线以 EnterpriseOps Gym 数据集为例演示,任务由系统规范、用户提示词和验证器三部分组成,需满足可行性、真实性与难度要求。随着模型改进,课程会自动转向其仍未掌握的能力。

10月1日周四
  1. Microsoft Research37

    微软研究院用机器学习预测电网空间天气风险

    微软研究院实习生构建的机器学习流水线,利用 L1 太阳风观测、AE 与 Dst 指数预报、地质电导率及电网数据,为美国本土 66,935 座变电站生成 30-60 分钟前的点位级地磁感应电流风险估计。2020-2026 评估期内,该系统对主要空间天气事件检出率近 80%,Dst 预测在 62.2% 的高活跃时段优于 Burton 方程。

9月30日周三
9月25日周五
9月24日周四
  1. Microsoft Research63

    微软研究院研究物理 AI 机器人推理卸载并推出 Physical AI Toolchain 新能力

    微软研究院发布机器人物理 AI 推理卸载的测量研究,发现将推理完全放在机器人端侧 GPU 会限制性能、续航与可扩展性,而卸载到边缘或云端 GPU 在移动操作任务中可提升成功率、支持更大模型并显著改善电池寿命。

    推荐理由:微软研究院系统测量了机器人端侧推理的限制,并给出 Kubernetes 卸载方案,可迁移到具身智能部署。

9月21日周一
9月18日周五
9月7日周一
8月24日周一
7月29日周三
7月26日周日
  1. Berkeley AI Research27

    Berkeley AI Research 提出 ABBEL:用信念状态监督 LLM 长程交互

    Berkeley AI Research 提出 ABBEL 框架,将递归摘要的信息内容隔离为自然语言"信念状态"并加以监督,替代完整交互历史作为智能体的工作上下文。在 CollabBench 协作编程任务上,基于重建的信念评分将 ABBEL 与全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 长度由 14.08×10² 降至 6.01×10²。

5月8日周五
4月20日周一
  1. Berkeley AI Research42

    GRASP:面向世界模型长时程规划的梯度规划器

    伯克利研究团队提出 GRASP,一种面向学习型世界模型的梯度规划器,通过将轨迹 lift 到虚拟状态实现跨时间并行优化、向状态迭代直接注入随机性以探索,并重塑梯度以避开经由高维视觉模型的脆弱"状态-输入"梯度。该方法针对长时程规划中梯度爆炸/消失、非贪心结构与高维隐空间导致的失败模式,使长时程规划更稳健。

3月13日周五
1月10日周六
  1. Berkeley AI Research27

    加州伯克利提出信息驱动的成像系统设计框架,发表于 NeurIPS 2025

    加州伯克利团队提出以互信息直接评估和优化成像系统的框架,无需任务专用解码器,在彩色摄影、射电天文、无透镜成像和显微镜四个域中,信息估计能预测解码器性能并优化硬件设计。该方法利用已知噪声物理直接计算 H(Y|X),只需从测量数据中学习 H(Y),可用高斯过程、全高斯或自回归 PixelCNN 建模,且所需内存和算力低于端到端方法。