Liquid AI 发布 d1-3B 与 d1-omni-600M 端侧多模态决策模型
Liquid AI 开源 d1 决策模型家族两款模型:d1-3B 与实验性的 d1-omni-600M,均为开放权重并在 Hugging Face 上线。
推荐理由:Liquid AI 开源两款决策模型,给出端侧毫秒级延迟与七项基准对比,可据此判断小模型在边缘设备上做结构化决策的可行性。
Liquid AI 开源 d1 决策模型家族两款模型:d1-3B 与实验性的 d1-omni-600M,均为开放权重并在 Hugging Face 上线。
推荐理由:Liquid AI 开源两款决策模型,给出端侧毫秒级延迟与七项基准对比,可据此判断小模型在边缘设备上做结构化决策的可行性。
微软亚洲研究院开源 Agent Lightning v1.0,这是一个约 3500 行代码的轻量级智能体 RL 框架,采用 Harnessed Agentic RL 范式,实现部署用 harness 直接参与强化学习训练而无需在训练框架内重写 agent。
推荐理由:Agent Lightning v1.0 不到 3500 行实现完整智能体 RL 系统,读者可了解如何在真实 harness 上训练 agent。
NVIDIA 团队从 Nemotron 3 出发,用监督微调、强化学习与反馈式推理打造专精模型,在 IOI 2026 拿到 535.4/600,在 IMO 2026 拿到 30/42,两者都超过官方金牌线。
Google DeepMind 发布 EmbeddingGemma 2,这是基于 Gemma 4 架构、采用 Apache 2.0 许可的开源多模态嵌入模型,可将文本、图像、音频、视频映射到统一嵌入空间。
推荐理由:Google DeepMind 开源 740M 参数多模态嵌入模型,给出端侧内存占用与向量截断方法,可供本地检索与 RAG 选型参考。
GitHub 发布 ReviewBench,一个面向 AI 代码评审的开源离线基准,基于 1.039 亿个 GitHub PR 的语言与仓库规模分布,包含 19 种语言的 219 个公开 PR,金标由人工评审、前沿 LLM 和静态分析等多来源构建。
微软与 Hugging Face 联合发布 ThinkingBox,通过隔离 MCP 会话检查智能体留下的后端状态与副作用,而不是看它生成的文字,Bench 覆盖 507 个有状态业务流程、每个任务重复运行 20 次。
推荐理由:微软与 Hugging Face 联合发布的智能体基准,用后端数据库终态而非模型自述来判定成败,并公开了 507 个任务、20 次重复运行的完整环境。
Google DeepMind 推出 SynthID Bio,将水印技术用于合成生物学,把不可感知的签名嵌入生物代码,使其不仅在数字模型上可验证,在合成出的实体蛋白质上也能被检测,同时实验室测试显示不影响生物功能。
推荐理由:SynthID 水印能力从数字媒体延伸到合成生物,读者可了解蛋白质与结构水印的验证方式和生物安全筛查意义。
GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需指向 GitHub 仓库,就能自行识别入口点、编写 harness、运行 AFL++、读取覆盖率报告并生成漏洞报告。
推荐理由:GitHub 安全实验室给出了一套可复用的自主模糊测试流水线,读者可据此判断智能体能接手多少安全测试中的重复劳动。
微软研究院发布机器人物理 AI 推理卸载的测量研究,发现将推理完全放在机器人端侧 GPU 会限制性能、续航与可扩展性,而卸载到边缘或云端 GPU 在移动操作任务中可提升成功率、支持更大模型并显著改善电池寿命。
推荐理由:微软研究院系统测量了机器人端侧推理的限制,并给出 Kubernetes 卸载方案,可迁移到具身智能部署。
Microsoft Research 在 Nature 发表逆合成预测框架 RetroChimera,该框架结合 Transformer 模型 R-SMILES 2 与 GNN 模型 NeuralLoc,用学习式集成重排序整合两者的预测结果。
微软研究院推出 GigaPath-Flash 和 GigaTIME-Flash,用从十亿参数 GigaPath 编码器蒸馏出的 22M 参数 ViT-S tile 编码器替换原有骨干,30M 参数以内即可完成全切片表示与 H&E 到 mIF 的虚拟空间蛋白组预测,均以 Apache 2.0 许可开源。
伯克利 Sky Lab 团队为进化式 kernel 搜索框架 K-Search 新增 MLX 后端,通过结构化 CUDA-to-MLX 翻译层,把已有 CUDA kernel 当作知识库改编为 Apple Silicon 上的原生 kernel,而非从头重写。
伯克利研究团队提出 GRASP,一种面向学习型世界模型的梯度规划器,通过将轨迹 lift 到虚拟状态实现跨时间并行优化、向状态迭代直接注入随机性以探索,并重塑梯度以避开经由高维视觉模型的脆弱"状态-输入"梯度。该方法针对长时程规划中梯度爆炸/消失、非贪心结构与高维隐空间导致的失败模式,使长时程规划更稳健。
伯克利 AI 研究团队提出 SPEX 与 ProxySPEX 算法,可在特征、数据和模型组件归因中大规模识别驱动 LLM 行为的关键交互。SPEX 利用稀疏性与低阶性把交互搜索转化为稀疏恢复问题,ProxySPEX 进一步借助层级结构,以约 10 倍更少的消融实验达到 SPEX 的性能。
加州伯克利团队提出以互信息直接评估和优化成像系统的框架,无需任务专用解码器,在彩色摄影、射电天文、无透镜成像和显微镜四个域中,信息估计能预测解码器性能并优化硬件设计。该方法利用已知噪声物理直接计算 H(Y|X),只需从测量数据中学习 H(Y),可用高斯过程、全高斯或自回归 PixelCNN 建模,且所需内存和算力低于端到端方法。