跳到正文
10月6日周二
10月5日周一
  1. MIT Technology Review · AI26

    如何将 AI 智能体接入企业知识

    MIT Technology Review 基于 300 名数据与 AI 高管的调研发现,企业平均仅约 34% 的智能体 AI 项目能进入生产环境,知识匮乏是关键卡点。生产领先者(平均 61% 项目走出试点)在语义等知识能力上更强。数据碎片化被 55% 受访者列为扩展智能体知识访问的首要挑战,企业将优先投资检索管线、AI-ready API、RAG 与知识图谱。

10月4日周日
  1. Hugging Face Blog69

    微软发布 ThinkingBox:用数据库终态而非自述评判 AI 智能体

    微软与 Hugging Face 联合发布 ThinkingBox,通过隔离 MCP 会话检查智能体留下的后端状态与副作用,而不是看它生成的文字,Bench 覆盖 507 个有状态业务流程、每个任务重复运行 20 次。

    推荐理由:微软与 Hugging Face 联合发布的智能体基准,用后端数据库终态而非模型自述来判定成败,并公开了 507 个任务、20 次重复运行的完整环境。

10月2日周五
  1. Hugging Face Blog45

    AutoSynthData:为企业级智能体生成训练数据

    ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例和更强教师的成功案例,定位当前模型的能力缺口,并据此生成、验证新的可执行训练任务。管线以 EnterpriseOps Gym 数据集为例演示,任务由系统规范、用户提示词和验证器三部分组成,需满足可行性、真实性与难度要求。随着模型改进,课程会自动转向其仍未掌握的能力。

9月25日周五
9月7日周一
7月26日周日
  1. Berkeley AI Research27

    Berkeley AI Research 提出 ABBEL:用信念状态监督 LLM 长程交互

    Berkeley AI Research 提出 ABBEL 框架,将递归摘要的信息内容隔离为自然语言"信念状态"并加以监督,替代完整交互历史作为智能体的工作上下文。在 CollabBench 协作编程任务上,基于重建的信念评分将 ABBEL 与全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 长度由 14.08×10² 降至 6.01×10²。