Google 发布智能体隐私与安全 workshop 报告:从上下文完整性视角探讨开放问题
Google 发布了一份关于智能体隐私与安全的新 workshop 报告,由 50 多位学界与业界人士在 2025 年底于纽约举行的 Google CAPS Workshop 上协作完成。
Google 发布了一份关于智能体隐私与安全的新 workshop 报告,由 50 多位学界与业界人士在 2025 年底于纽约举行的 Google CAPS Workshop 上协作完成。
MIT Technology Review 基于 300 名数据与 AI 高管的调研发现,企业平均仅约 34% 的智能体 AI 项目能进入生产环境,知识匮乏是关键卡点。生产领先者(平均 61% 项目走出试点)在语义等知识能力上更强。数据碎片化被 55% 受访者列为扩展智能体知识访问的首要挑战,企业将优先投资检索管线、AI-ready API、RAG 与知识图谱。
微软与 Hugging Face 联合发布 ThinkingBox,通过隔离 MCP 会话检查智能体留下的后端状态与副作用,而不是看它生成的文字,Bench 覆盖 507 个有状态业务流程、每个任务重复运行 20 次。
推荐理由:微软与 Hugging Face 联合发布的智能体基准,用后端数据库终态而非模型自述来判定成败,并公开了 507 个任务、20 次重复运行的完整环境。
ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例和更强教师的成功案例,定位当前模型的能力缺口,并据此生成、验证新的可执行训练任务。管线以 EnterpriseOps Gym 数据集为例演示,任务由系统规范、用户提示词和验证器三部分组成,需满足可行性、真实性与难度要求。随着模型改进,课程会自动转向其仍未掌握的能力。
Google Research 发布 AI video co-director 等四个框架,构建在 Gemini 和 Veo 之上,用于自动化生成连贯的多镜头长视频。
Google DeepMind 发表论文,让 100 个运行 Gemini 3.1 Pro 的自主智能体尝试解决 Formal Conjectures 数据集中的 71 道数学题。
Berkeley AI Research 提出 ABBEL 框架,将递归摘要的信息内容隔离为自然语言"信念状态"并加以监督,替代完整交互历史作为智能体的工作上下文。在 CollabBench 协作编程任务上,基于重建的信念评分将 ABBEL 与全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 长度由 14.08×10² 降至 6.01×10²。