跳到正文

#语音

今日 0 条
9月29日周二
9月26日周六
9月25日周五
9月23日周三
  1. Google DeepMind65

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 语音生成模型

    Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,覆盖 100 多种语言和方言,支持从 30 秒音频样本复刻声音、逐行导演表演节奏以及原生双说话人场景编排。

    推荐理由:官方发布说明了两个 TTS 模型的定位、评测成绩和语音设计能力,开发者可以直接对照评测与入口评估是否接入。

9月16日周三
9月10日周四
8月28日周五
8月27日周四
8月21日周五
  1. Hugging Face Blog61

    Hugging Face 研究量化语音识别模型的基准优化行为

    Hugging Face 发布研究,提出三种测试量化 ASR 模型的基准优化(benchmaxxing)现象。评估 11 个开源模型发现,部分高分模型会复现 VoxPopuli 与 LibriSpeech 的错误参考文本、在音频中数字被静音时仍以约 30-40% 的比例输出该数字,并通过声学线索切换拼写以匹配基准期望;在模型训练截止后新采集的同源音频上,这些行为明显减弱。

    推荐理由:研究用三种探针量化了语音识别中的基准优化行为,为选型者提供了超越公开基准 WER 的评估思路。

8月11日周二
  1. Hugging Face Blog60

    NVIDIA 发布 Magpie TTS Multilingual 开放权重模型,支持 12 种语言并降低语音生成延迟

    NVIDIA 发布 Magpie TTS Multilingual 开放权重模型,参数量 364M,新增现代标准阿拉伯语、韩语和巴西葡萄牙语,共支持 12 种语言,并提供生产级 NIM 部署容器。

    推荐理由:原文给出TTFA延迟数据和架构改进细节,读者可据此评估自部署级联语音方案相对一体化语音模型的取舍。

7月30日周四
7月15日周三
  1. Hugging Face Blog51

    Hume 推出 Real World VoiceEQ 基准,衡量语音 AI 的人类级质量

    Hume 发布 Real World VoiceEQ 基准,基于超 100 万条人类评分,评估 40 多个专有与开源语音模型,覆盖 ASR、TTS、S2S 和语音理解的 15+ 维度、60+ 指标。评估发现 TTS 无一配置在八组能力中均进前五,语音模型听比说差,许多系统仍以转录文本为主而忽略语气、迟疑等副语言线索;部分模型疑似针对公开基准优化,SLM 自动评估仅适合明确任务,尚难替代人类听评。

7月1日周三
6月9日周二
4月30日周四
4月16日周四
  1. Google DeepMind62

    Google DeepMind 发布 Gemini 3.1 Flash TTS 语音模型

    Google DeepMind 发布文本转语音模型 Gemini 3.1 Flash TTS,主打更强的可控性、表达力和音质,在 Artificial Analysis TTS 排行榜获得 Elo 1,211 分。

    推荐理由:官方宣布了音频标签等新控制方式和上线渠道,并给出 Artificial Analysis 的 Elo 分数,可据此评估其表达力与成本定位。

3月24日周二
  1. Mistral AI63

    Mistral AI 发布 4B 参数语音生成模型 Voxtral TTS

    Mistral AI 发布首个文本转语音模型 Voxtral TTS,参数量 4B,支持英语、法语、德语等 9 种语言。人工评测显示其自然度优于 ElevenLabs Flash v2.5,与 ElevenLabs v3 质量相当;模型延迟 70ms,支持 3 秒参考音色的零样本语音适配与跨语言口音迁移。

    推荐理由:官方给出了延迟、定价、语言支持与对比评测等关键细节,读者可以据此评估它在企业语音工作流中的可用性。

3月7日周六
  1. Google Research59

    Google Research 发布 WAXAL:覆盖 27 种撒哈拉以南非洲语言的大规模开放语音数据集

    Google Research 发布开放语音数据集 WAXAL,覆盖 27 种撒哈拉以南非洲语言,使用者超过 1 亿人、分布于 26 个国家。数据集包含约 1,846 小时经转写的自然语音(WAXAL-ASR,采用图像提示引发自发语音)和超过 565 小时高保真 TTS 录音,以 CC-BY-4.0 许可开放,由 Makerere 大学、加纳大学等非洲学术与社区组织主导采集。

2月5日周四
7月17日周四
7月15日周二