Odyssey-3 世界模型开放免费试用,并公布物理基准成绩
Odyssey 将世界模型 Odyssey-3 开放公开研究预览,用户可用文本提示词生成可实时探索的交互环境,开发者可申请 API 访问。免费在线 demo 基于 Odyssey-3 Flash,采用自回归扩散 Transformer 生成视频帧,基础模型 14B 参数、832 × 480 像素,Pro 版支持 1280 × 720 像素。
Odyssey 将世界模型 Odyssey-3 开放公开研究预览,用户可用文本提示词生成可实时探索的交互环境,开发者可申请 API 访问。免费在线 demo 基于 Odyssey-3 Flash,采用自回归扩散 Transformer 生成视频帧,基础模型 14B 参数、832 × 480 像素,Pro 版支持 1280 × 720 像素。
微软推出自研决策模型 Decision-1,用于分类、评估和路由决策,基于 Qwen3.5-9B,可通过 Microsoft Foundry 和 OpenRouter 使用,输入 tokens 每百万 $0.042、输出 tokens 免费。
Anthropic 发布时隔约一年的 Haiku 层级更新 Claude Haiku 5.5,定价与 OpenAI 的 GPT-6 Luna 一致,同日下调 Sonnet 5.5 缓存读取价格和订阅套餐价格。
推荐理由:除发布本身外,还汇总了第三方评测的 token 消耗与分层定价,便于判断真实成本。
Liquid AI 开源 d1 决策模型家族两款模型:d1-3B 与实验性的 d1-omni-600M,均为开放权重并在 Hugging Face 上线。
推荐理由:Liquid AI 开源两款决策模型,给出端侧毫秒级延迟与七项基准对比,可据此判断小模型在边缘设备上做结构化决策的可行性。
Mistral 发布新模型 Mistral Large 4,拥有 1 万亿参数,昵称 Le Chonk,任何人都可使用和定制,目前处于预览阶段,正式版将在月底前推出。
阿布扎比技术创新研究院(TII)发布 Falcon-ASR,一个 1.6B 参数的语音识别模型,重点面向阿拉伯语尤其是阿联酋方言,同时支持英语、法语、西班牙语和葡萄牙语。
Google DeepMind 发布 EmbeddingGemma 2,这是基于 Gemma 4 架构、采用 Apache 2.0 许可的开源多模态嵌入模型,可将文本、图像、音频、视频映射到统一嵌入空间。
推荐理由:Google DeepMind 开源 740M 参数多模态嵌入模型,给出端侧内存占用与向量截断方法,可供本地检索与 RAG 选型参考。
Mistral AI 发布 Mistral Large 4 公开预览,可通过 Mistral Studio 试用预览 API,权重计划于本月底开放。ML4 是 1 万亿参数、52B 激活参数的原生多模态模型,在欧洲自有数据中心的 3,800 块 NVIDIA Grace Blackwell GPU 上从零训练,官方称其在编码、智能体工作流和多模态理解上可与最强开源模型竞争。
推荐理由:官方给出 1 万亿参数、52B 激活的开放权重模型细节与多类基准对比,可据此判断开源前沿模型的能力位置。
OpenAI 的 GPT-6 Astra Ultrafast 已上线 OpenAI API,并向符合条件的 ChatGPT Work 和 Codex 用户开放,运行在 NVIDIA Blackwell GPU 上。
推荐理由:原文给出 GPT-6 Astra Ultrafast 在 Blackwell 上的提速数据与开放入口,读者可据此判断它对编码智能体循环的影响。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御者开放,随后逐步向开发者、企业和消费者推出。
推荐理由:原文给出 Argon 在编码与网络安全防御上的基准成绩和 Google 内部落地案例,读者可据此判断前沿模型的能力边界。
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向深度创作与角色设计,后者面向高并发、低成本场景。
推荐理由:官方给出两款 TTS 模型的语音定制能力、基准排名和上线渠道,可据此判断多语言语音生成的可用性。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时语音对话模型。
推荐理由:两款实时语音对话模型同时给出语音质量榜单分数和逐步开放的入口,可用于判断语音智能体的可用边界。
微软研究院推出 GigaPath-Flash 和 GigaTIME-Flash,用从十亿参数 GigaPath 编码器蒸馏出的 22M 参数 ViT-S tile 编码器替换原有骨干,30M 参数以内即可完成全切片表示与 H&E 到 mIF 的虚拟空间蛋白组预测,均以 Apache 2.0 许可开源。