跳到正文
10月5日周一
10月4日周日
  1. Hugging Face Blog69

    微软发布 ThinkingBox:用数据库终态而非自述评判 AI 智能体

    微软与 Hugging Face 联合发布 ThinkingBox,通过隔离 MCP 会话检查智能体留下的后端状态与副作用,而不是看它生成的文字,Bench 覆盖 507 个有状态业务流程、每个任务重复运行 20 次。

    推荐理由:微软与 Hugging Face 联合发布的智能体基准,用后端数据库终态而非模型自述来判定成败,并公开了 507 个任务、20 次重复运行的完整环境。

9月30日周三
9月25日周五
8月24日周一
7月26日周日
  1. Berkeley AI Research27

    Berkeley AI Research 提出 ABBEL:用信念状态监督 LLM 长程交互

    Berkeley AI Research 提出 ABBEL 框架,将递归摘要的信息内容隔离为自然语言"信念状态"并加以监督,替代完整交互历史作为智能体的工作上下文。在 CollabBench 协作编程任务上,基于重建的信念评分将 ABBEL 与全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 长度由 14.08×10² 降至 6.01×10²。