跳到正文

语音与音频

AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。

11条精选相关主题多模态AI 视频产品更新

最新精选

第 1–11 条 · 共 11 条
9月23日周三
  1. Google DeepMind65

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 语音生成模型

    Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,覆盖 100 多种语言和方言,支持从 30 秒音频样本复刻声音、逐行导演表演节奏以及原生双说话人场景编排。

    推荐理由:官方发布说明了两个 TTS 模型的定位、评测成绩和语音设计能力,开发者可以直接对照评测与入口评估是否接入。

9月16日周三
8月27日周四
8月21日周五
  1. Hugging Face Blog61

    Hugging Face 研究量化语音识别模型的基准优化行为

    Hugging Face 发布研究,提出三种测试量化 ASR 模型的基准优化(benchmaxxing)现象。评估 11 个开源模型发现,部分高分模型会复现 VoxPopuli 与 LibriSpeech 的错误参考文本、在音频中数字被静音时仍以约 30-40% 的比例输出该数字,并通过声学线索切换拼写以匹配基准期望;在模型训练截止后新采集的同源音频上,这些行为明显减弱。

    推荐理由:研究用三种探针量化了语音识别中的基准优化行为,为选型者提供了超越公开基准 WER 的评估思路。

8月11日周二
  1. Hugging Face Blog60

    NVIDIA 发布 Magpie TTS Multilingual 开放权重模型,支持 12 种语言并降低语音生成延迟

    NVIDIA 发布 Magpie TTS Multilingual 开放权重模型,参数量 364M,新增现代标准阿拉伯语、韩语和巴西葡萄牙语,共支持 12 种语言,并提供生产级 NIM 部署容器。

    推荐理由:原文给出TTFA延迟数据和架构改进细节,读者可据此评估自部署级联语音方案相对一体化语音模型的取舍。

7月1日周三
6月9日周二
4月16日周四
  1. Google DeepMind62

    Google DeepMind 发布 Gemini 3.1 Flash TTS 语音模型

    Google DeepMind 发布文本转语音模型 Gemini 3.1 Flash TTS,主打更强的可控性、表达力和音质,在 Artificial Analysis TTS 排行榜获得 Elo 1,211 分。

    推荐理由:官方宣布了音频标签等新控制方式和上线渠道,并给出 Artificial Analysis 的 Elo 分数,可据此评估其表达力与成本定位。

3月24日周二
  1. Mistral AI63

    Mistral AI 发布 4B 参数语音生成模型 Voxtral TTS

    Mistral AI 发布首个文本转语音模型 Voxtral TTS,参数量 4B,支持英语、法语、德语等 9 种语言。人工评测显示其自然度优于 ElevenLabs Flash v2.5,与 ElevenLabs v3 质量相当;模型延迟 70ms,支持 3 秒参考音色的零样本语音适配与跨语言口音迁移。

    推荐理由:官方给出了延迟、定价、语言支持与对比评测等关键细节,读者可以据此评估它在企业语音工作流中的可用性。

2月5日周四
7月15日周二