Nemotron 微调后在 IOI 2026 与 IMO 2026 均达金牌水平
NVIDIA 团队从 Nemotron 3 出发,用监督微调、强化学习与反馈式推理打造专精模型,在 IOI 2026 拿到 535.4/600,在 IMO 2026 拿到 30/42,两者都超过官方金牌线。
NVIDIA 团队从 Nemotron 3 出发,用监督微调、强化学习与反馈式推理打造专精模型,在 IOI 2026 拿到 535.4/600,在 IMO 2026 拿到 30/42,两者都超过官方金牌线。
微软与 Hugging Face 联合发布 ThinkingBox,通过隔离 MCP 会话检查智能体留下的后端状态与副作用,而不是看它生成的文字,Bench 覆盖 507 个有状态业务流程、每个任务重复运行 20 次。
推荐理由:微软与 Hugging Face 联合发布的智能体基准,用后端数据库终态而非模型自述来判定成败,并公开了 507 个任务、20 次重复运行的完整环境。
ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例和更强教师的成功案例,定位当前模型的能力缺口,并据此生成、验证新的可执行训练任务。管线以 EnterpriseOps Gym 数据集为例演示,任务由系统规范、用户提示词和验证器三部分组成,需满足可行性、真实性与难度要求。随着模型改进,课程会自动转向其仍未掌握的能力。
Hugging Face 发布 Open TTS Leaderboard,用 WER/CER、RTFx、TTFA 和 WavLM 说话人相似度等客观指标评测开源与多语言 TTS 模型,单模型评测从数周投票缩短到数小时。