跳到正文
  1. Hugging Face Blog62

    Liquid AI 发布 d1-3B 与 d1-omni-600M 端侧多模态决策模型

    Liquid AI 开源 d1 决策模型家族两款模型:d1-3B 与实验性的 d1-omni-600M,均为开放权重并在 Hugging Face 上线。

    推荐理由:Liquid AI 开源两款决策模型,给出端侧毫秒级延迟与七项基准对比,可据此判断小模型在边缘设备上做结构化决策的可行性。

  1. Google DeepMind71

    Google DeepMind 发布 EmbeddingGemma 2,轻量开源多模态嵌入模型

    Google DeepMind 发布 EmbeddingGemma 2,这是基于 Gemma 4 架构、采用 Apache 2.0 许可的开源多模态嵌入模型,可将文本、图像、音频、视频映射到统一嵌入空间。

    推荐理由:Google DeepMind 开源 740M 参数多模态嵌入模型,给出端侧内存占用与向量截断方法,可供本地检索与 RAG 选型参考。

  1. Mistral AI84

    Mistral 发布 Mistral Large 4 公开预览,1 万亿参数多模态模型

    Mistral AI 发布 Mistral Large 4 公开预览,可通过 Mistral Studio 试用预览 API,权重计划于本月底开放。ML4 是 1 万亿参数、52B 激活参数的原生多模态模型,在欧洲自有数据中心的 3,800 块 NVIDIA Grace Blackwell GPU 上从零训练,官方称其在编码、智能体工作流和多模态理解上可与最强开源模型竞争。

    推荐理由:官方给出 1 万亿参数、52B 激活的开放权重模型细节与多类基准对比,可据此判断开源前沿模型的能力位置。

  1. Google DeepMind72

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS

    Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向深度创作与角色设计,后者面向高并发、低成本场景。

    推荐理由:官方给出两款 TTS 模型的语音定制能力、基准排名和上线渠道,可据此判断多语言语音生成的可用性。

已经到底了