TII 发布 1.6B 参数语音识别模型 Falcon-ASR
阿布扎比技术创新研究院(TII)发布 Falcon-ASR,一个 1.6B 参数的语音识别模型,重点面向阿拉伯语尤其是阿联酋方言,同时支持英语、法语、西班牙语和葡萄牙语。
阿布扎比技术创新研究院(TII)发布 Falcon-ASR,一个 1.6B 参数的语音识别模型,重点面向阿拉伯语尤其是阿联酋方言,同时支持英语、法语、西班牙语和葡萄牙语。
Hugging Face 发布 Open TTS Leaderboard,用 WER/CER、RTFx、TTFA 和 WavLM 说话人相似度等客观指标评测开源与多语言 TTS 模型,单模型评测从数周投票缩短到数小时。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,把近实时视频生成与语音结合,为 Gemini 的实时对话模型带来视觉形象。
推荐理由:官方给出 Live Avatar 在对话中实时生成视频与语音的能力,读者可据此评估企业虚拟客服的交互形态变化。
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向深度创作与角色设计,后者面向高并发、低成本场景。
推荐理由:官方给出两款 TTS 模型的语音定制能力、基准排名和上线渠道,可据此判断多语言语音生成的可用性。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时语音对话模型。
推荐理由:两款实时语音对话模型同时给出语音质量榜单分数和逐步开放的入口,可用于判断语音智能体的可用边界。