ElevenLabs 发布 Eleven v4 语音模型,表现力与一致性提升并推出 Turbo 实时变体
ElevenLabs 发布新语音模型 Eleven v4,对音频标签的遵循更准确,单次支持最多 10,000 字符约十分钟音频,语言支持从约 70 种增至 90 种以上,发音基准得分从 v3 的 85.6% 升至 91.7%。
ElevenLabs 发布新语音模型 Eleven v4,对音频标签的遵循更准确,单次支持最多 10,000 字符约十分钟音频,语言支持从约 70 种增至 90 种以上,发音基准得分从 v3 的 85.6% 升至 91.7%。
波士顿语音智能初创公司 Modulate 完成 2500 万美元融资,由 Future Ventures 领投,Hyperplane 和 Lakestar 参投,此前融资总额达 4100 万美元、估值 1.7 亿美元。
创始人 Tarini Padmanabhuni 因祖父被 AI 伪造语音骗取赎金,创办旧金山公司 DetectifAI,从零设计可在手机操作系统内运行的小型模型,通话与语音消息可在不离开设备的情况下即时判定是否为 AI 生成。
AWS 发布教程,讲解如何在 Amazon SageMaker AI 上通过 vLLM-Omni DLC 部署 Qwen3-TTS,实现语音生成完成前即可开始播放的流式语音输出。
Alibaba Cloud Qwen 团队开源的 Qwen3-TTS-12Hz-1.7B-Base 文本转语音模型现可通过 Amazon SageMaker JumpStart 部署到全托管实时推理端点。
Google DeepMind 在 Gemini 3.8 Live 发布一周后推出 Live Avatar 功能,为对话模型带来近实时的视频形象。
AWS 发布 WhisperX 深度学习容器(DLC),在 OpenAI Whisper 基础上加入批处理推理、wav2vec2 强制对齐的词级时间戳和说话人分离,可在 SageMaker AI 上一键部署。
Meta 在 Connect 2026 上将个人智能体 Muse 作为核心,推出语音与实时视频支持、Muse Mail 邮箱、Mac 电脑操作、1,500+ 应用的 connector 平台,以及 Muse Realtime Avatar 研究版(响应不到一秒)。
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,覆盖 100 多种语言和方言,支持从 30 秒音频样本复刻声音、逐行导演表演节奏以及原生双说话人场景编排。
推荐理由:官方发布说明了两个 TTS 模型的定位、评测成绩和语音设计能力,开发者可以直接对照评测与入口评估是否接入。
客服公司 Ringg 采用 GPT-5.6 驱动其 AI 智能体,最多可自动解决 65% 的客户来电。这些智能体覆盖语音、聊天、WhatsApp 和网页等多语言渠道,成本相比使用 GPT-4.1 降低 90%。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款语音对话模型,主打近实时推理与语音智能体。
推荐理由:官方给出两款语音对话模型的评测成绩、语言与工具调用能力和开放入口,读者可据此评估其用于语音智能体开发的适配度。
OpenAI 在 API 中推出 GPT‑Live‑1,带来自然的全双工语音对话能力。模型具备更强的指令遵循能力,支持自定义音色和电话接入。
Voice Arena 与 Hugging Face 合作,在 Open ASR Leaderboard 中引入 Monsoon en-IN 和 Monsoon hi-IN 两个评测集,印地语成为该多语言榜单上的首个 Indic 语言。
Google DeepMind 推出 Gemini 3.5 Transcribe,定位为其最精准的实时语音转写模型,可清理语气词、自动格式化并识别自定义词表。
推荐理由:官方发布带具体 WER、延迟和 API 形态,开发者可据此评估语音转写与语音交互方案的选型。
Hugging Face 发布研究,提出三种测试量化 ASR 模型的基准优化(benchmaxxing)现象。评估 11 个开源模型发现,部分高分模型会复现 VoxPopuli 与 LibriSpeech 的错误参考文本、在音频中数字被静音时仍以约 30-40% 的比例输出该数字,并通过声学线索切换拼写以匹配基准期望;在模型训练截止后新采集的同源音频上,这些行为明显减弱。
推荐理由:研究用三种探针量化了语音识别中的基准优化行为,为选型者提供了超越公开基准 WER 的评估思路。
NVIDIA 发布 Magpie TTS Multilingual 开放权重模型,参数量 364M,新增现代标准阿拉伯语、韩语和巴西葡萄牙语,共支持 12 种语言,并提供生产级 NIM 部署容器。
推荐理由:原文给出TTFA延迟数据和架构改进细节,读者可据此评估自部署级联语音方案相对一体化语音模型的取舍。
Google DeepMind 推出新一代音乐生成模型 Lyria 3.5,现已在 Google Flow Music 中上线。新模型改进了音乐性,可生成更丰富自然的旋律结构;歌词质量和提示词遵循度更高;人声更真实、更具情感表达且发音更准。用户还可更方便地控制生成音乐的节奏和时长。
Hume 发布 Real World VoiceEQ 基准,基于超 100 万条人类评分,评估 40 多个专有与开源语音模型,覆盖 ASR、TTS、S2S 和语音理解的 15+ 维度、60+ 指标。评估发现 TTS 无一配置在八组能力中均进前五,语音模型听比说差,许多系统仍以转录文本为主而忽略语气、迟疑等副语言线索;部分模型疑似针对公开基准优化,SLM 自动评估仅适合明确任务,尚难替代人类听评。
Hugging Face 与 Cerebras 发布一个模块化、开源的实时语音对话(speech-to-speech)流水线,用 Cerebras 的高速推理解决语言模型响应延迟瓶颈。
推荐理由:原文给出了完整开放的级联语音对话架构和各层组件,开发者可以照此搭建或替换自己的实时语音 AI 流水线。
段已按要求撰写
推荐理由:原文给出 70 多种语言的近实时语音翻译能力、流式生成机制和各产品线的开放入口,读者可以据此判断它对会议和翻译场景的实际影响。
Google DeepMind 宣布 AI co-clinician 研究计划,探索在医生监督下协助患者就诊的 AI 智能体。
Google DeepMind 发布文本转语音模型 Gemini 3.1 Flash TTS,主打更强的可控性、表达力和音质,在 Artificial Analysis TTS 排行榜获得 Elo 1,211 分。
推荐理由:官方宣布了音频标签等新控制方式和上线渠道,并给出 Artificial Analysis 的 Elo 分数,可据此评估其表达力与成本定位。
Mistral AI 发布首个文本转语音模型 Voxtral TTS,参数量 4B,支持英语、法语、德语等 9 种语言。人工评测显示其自然度优于 ElevenLabs Flash v2.5,与 ElevenLabs v3 质量相当;模型延迟 70ms,支持 3 秒参考音色的零样本语音适配与跨语言口音迁移。
推荐理由:官方给出了延迟、定价、语言支持与对比评测等关键细节,读者可以据此评估它在企业语音工作流中的可用性。
Google Research 发布开放语音数据集 WAXAL,覆盖 27 种撒哈拉以南非洲语言,使用者超过 1 亿人、分布于 26 个国家。数据集包含约 1,846 小时经转写的自然语音(WAXAL-ASR,采用图像提示引发自发语音)和超过 565 小时高保真 TTS 录音,以 CC-BY-4.0 许可开放,由 Makerere 大学、加纳大学等非洲学术与社区组织主导采集。
Mistral 发布 Voxtral Transcribe 2,包含 Voxtral Mini Transcribe V2 批量转写模型和 Voxtral Realtime 实时模型。
推荐理由:官方给出两款语音转写模型的延迟、价格、词错率与开源权重信息,读者可据此评估语音转写方案选型。
Mistral AI 为 Le Chat 推出一批新功能,包括 Deep Research(预览)研究模式、基于 Voxtral 模型的语音模式、由 Magistral 推理模型驱动的多语言思考模式、Projects 项目文件夹,以及与 Black Forest Labs 合作的图像编辑。
Mistral 发布 Voxtral 语音理解模型,提供 24B 生产级和 3B 本地/端侧两个版本,均以 Apache 2.0 许可开源,并可通过 API 调用,价格低至 $0.001 每分钟。
推荐理由:官方发布给出了两个规格、许可、价格和基准结果,读者可以据此评估它在语音理解场景替代现有方案的可行性。