ElevenLabs 发布 Eleven v4 语音模型,表现力与一致性提升并推出 Turbo 实时变体
ElevenLabs 发布新语音模型 Eleven v4,对音频标签的遵循更准确,单次支持最多 10,000 字符约十分钟音频,语言支持从约 70 种增至 90 种以上,发音基准得分从 v3 的 85.6% 升至 91.7%。
ElevenLabs 发布新语音模型 Eleven v4,对音频标签的遵循更准确,单次支持最多 10,000 字符约十分钟音频,语言支持从约 70 种增至 90 种以上,发音基准得分从 v3 的 85.6% 升至 91.7%。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款语音对话模型,主打近实时推理与语音智能体。
推荐理由:官方给出两款语音对话模型的评测成绩、语言与工具调用能力和开放入口,读者可据此评估其用于语音智能体开发的适配度。
Google DeepMind 推出 Gemini 3.5 Transcribe,定位为其最精准的实时语音转写模型,可清理语气词、自动格式化并识别自定义词表。
推荐理由:官方发布带具体 WER、延迟和 API 形态,开发者可据此评估语音转写与语音交互方案的选型。
NVIDIA 发布 Magpie TTS Multilingual 开放权重模型,参数量 364M,新增现代标准阿拉伯语、韩语和巴西葡萄牙语,共支持 12 种语言,并提供生产级 NIM 部署容器。
推荐理由:原文给出TTFA延迟数据和架构改进细节,读者可据此评估自部署级联语音方案相对一体化语音模型的取舍。
Mistral 发布 Voxtral Transcribe 2,包含 Voxtral Mini Transcribe V2 批量转写模型和 Voxtral Realtime 实时模型。
推荐理由:官方给出两款语音转写模型的延迟、价格、词错率与开源权重信息,读者可据此评估语音转写方案选型。
Mistral 发布 Voxtral 语音理解模型,提供 24B 生产级和 3B 本地/端侧两个版本,均以 Apache 2.0 许可开源,并可通过 API 调用,价格低至 $0.001 每分钟。
推荐理由:官方发布给出了两个规格、许可、价格和基准结果,读者可以据此评估它在语音理解场景替代现有方案的可行性。