Odyssey-3 世界模型开放免费试用,并公布物理基准成绩
Odyssey 将世界模型 Odyssey-3 开放公开研究预览,用户可用文本提示词生成可实时探索的交互环境,开发者可申请 API 访问。免费在线 demo 基于 Odyssey-3 Flash,采用自回归扩散 Transformer 生成视频帧,基础模型 14B 参数、832 × 480 像素,Pro 版支持 1280 × 720 像素。
Odyssey 将世界模型 Odyssey-3 开放公开研究预览,用户可用文本提示词生成可实时探索的交互环境,开发者可申请 API 访问。免费在线 demo 基于 Odyssey-3 Flash,采用自回归扩散 Transformer 生成视频帧,基础模型 14B 参数、832 × 480 像素,Pro 版支持 1280 × 720 像素。
Anthropic 发布时隔约一年的 Haiku 层级更新 Claude Haiku 5.5,定价与 OpenAI 的 GPT-6 Luna 一致,同日下调 Sonnet 5.5 缓存读取价格和订阅套餐价格。
推荐理由:除发布本身外,还汇总了第三方评测的 token 消耗与分层定价,便于判断真实成本。
阿布扎比技术创新研究院(TII)发布 Falcon-ASR,一个 1.6B 参数的语音识别模型,重点面向阿拉伯语尤其是阿联酋方言,同时支持英语、法语、西班牙语和葡萄牙语。
Microsoft 的 Jennifer Neville 在 Microsoft Research Podcast 中讨论评估如何推动 AI 系统性能边界,以及在传统基准之外测试模型时出现的「意外失败」。她结合自己从数学、物理、认知科学到计算机科学的经历,分享使用当前 AI 系统的实用建议,并强调结果超出预期时应仔细审视数据。
GitHub 发布 ReviewBench,一个面向 AI 代码评审的开源离线基准,基于 1.039 亿个 GitHub PR 的语言与仓库规模分布,包含 19 种语言的 219 个公开 PR,金标由人工评审、前沿 LLM 和静态分析等多来源构建。
微软与 Hugging Face 联合发布 ThinkingBox,通过隔离 MCP 会话检查智能体留下的后端状态与副作用,而不是看它生成的文字,Bench 覆盖 507 个有状态业务流程、每个任务重复运行 20 次。
推荐理由:微软与 Hugging Face 联合发布的智能体基准,用后端数据库终态而非模型自述来判定成败,并公开了 507 个任务、20 次重复运行的完整环境。
Hugging Face 发布 Open TTS Leaderboard,用 WER/CER、RTFx、TTFA 和 WavLM 说话人相似度等客观指标评测开源与多语言 TTS 模型,单模型评测从数周投票缩短到数小时。
Google Research 发布 AI video co-director 等四个框架,构建在 Gemini 和 Veo 之上,用于自动化生成连贯的多镜头长视频。
METR 分析显示 AI 对科学的加速并不均衡:2026 年 cURL、OpenSSL、Firefox 等项目的漏洞报告速度较 2025 年大幅加快,数学领域只是小幅加速,而 AI 研究本身的算法进展尚无可测加速。
Import AI 第 469 期介绍新基准 DiG-bench,包含 70 款规则与目标均隐藏的文本游戏,部分公开可玩,顶级模型 Opus 5 与 Fable 5 搭配 Claude Code 表现最佳,但仍远逊于人类。
Berkeley AI Research 提出 ABBEL 框架,将递归摘要的信息内容隔离为自然语言"信念状态"并加以监督,替代完整交互历史作为智能体的工作上下文。在 CollabBench 协作编程任务上,基于重建的信念评分将 ABBEL 与全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 长度由 14.08×10² 降至 6.01×10²。