作者用 ML Intern 在几天内训出六个小模型,公开全部提示词
作者在 HuggingChat 里开启 ML-intern,用几句提示词就在几天内训出六个模型并发布到 Hub,总计算成本约 103 美元。
推荐理由:作者公开了六个模型项目从 450 词到 2000 词的提示词写法,含基线、冒烟测试与预算控制等可迁移步骤。
作者在 HuggingChat 里开启 ML-intern,用几句提示词就在几天内训出六个模型并发布到 Hub,总计算成本约 103 美元。
推荐理由:作者公开了六个模型项目从 450 词到 2000 词的提示词写法,含基线、冒烟测试与预算控制等可迁移步骤。
NVIDIA 与 Microsoft 在旧金山活动上宣布为 Windows PC 上的 AI 智能体共同设计硬件与软件,并发布 RTX Spark 笔记本与紧凑台式机。
推荐理由:RTX Spark 与 Windows PC 端本地 AI 栈的组合,给出了消费级硬件跑大模型的统一内存与算力规格。
微软亚洲研究院开源 Agent Lightning v1.0,这是一个约 3500 行代码的轻量级智能体 RL 框架,采用 Harnessed Agentic RL 范式,实现部署用 harness 直接参与强化学习训练而无需在训练框架内重写 agent。
推荐理由:Agent Lightning v1.0 不到 3500 行实现完整智能体 RL 系统,读者可了解如何在真实 harness 上训练 agent。
Mistral AI 发布 Mistral Large 4 公开预览,可通过 Mistral Studio 试用预览 API,权重计划于本月底开放。ML4 是 1 万亿参数、52B 激活参数的原生多模态模型,在欧洲自有数据中心的 3,800 块 NVIDIA Grace Blackwell GPU 上从零训练,官方称其在编码、智能体工作流和多模态理解上可与最强开源模型竞争。
推荐理由:官方给出 1 万亿参数、52B 激活的开放权重模型细节与多类基准对比,可据此判断开源前沿模型的能力位置。
微软与 Hugging Face 联合发布 ThinkingBox,通过隔离 MCP 会话检查智能体留下的后端状态与副作用,而不是看它生成的文字,Bench 覆盖 507 个有状态业务流程、每个任务重复运行 20 次。
推荐理由:微软与 Hugging Face 联合发布的智能体基准,用后端数据库终态而非模型自述来判定成败,并公开了 507 个任务、20 次重复运行的完整环境。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御者开放,随后逐步向开发者、企业和消费者推出。
推荐理由:原文给出 Argon 在编码与网络安全防御上的基准成绩和 Google 内部落地案例,读者可据此判断前沿模型的能力边界。
GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需指向 GitHub 仓库,就能自行识别入口点、编写 harness、运行 AFL++、读取覆盖率报告并生成漏洞报告。
推荐理由:GitHub 安全实验室给出了一套可复用的自主模糊测试流水线,读者可据此判断智能体能接手多少安全测试中的重复劳动。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时语音对话模型。
推荐理由:两款实时语音对话模型同时给出语音质量榜单分数和逐步开放的入口,可用于判断语音智能体的可用边界。
Mistral 帮助一家欧洲能源运营商把 4 万行 Fortran 77 迁移到 C++,对象是一个无测试套件、无集中文档的物理密集型油藏模拟器。
推荐理由:Mistral 公开了用智能体迁移 4 万行 Fortran 77 到 C++ 的完整流程和三次自主度取舍,可迁移到其他遗留系统改造。
Mistral 发布 Agentic Search,用 search、open、navigate、read、grep 五工具组成多步检索循环,让模型可在复杂文档中搜索、读取并核验信息。
推荐理由:原文用 FinanceBench 和 OfficeQA Pro 对比一次性 RAG,说明多步检索在准确率、延迟和 token 上的收益,可帮助判断是否引入 Agentic Search。