Open ASR Leaderboard 新增首个全球南方语言:Monsoon 印地语与印度英语评测集
Voice Arena 与 Hugging Face 合作,在 Open ASR Leaderboard 中引入 Monsoon en-IN 和 Monsoon hi-IN 两个评测集,印地语成为该多语言榜单上的首个 Indic 语言。
Voice Arena 与 Hugging Face 合作,在 Open ASR Leaderboard 中引入 Monsoon en-IN 和 Monsoon hi-IN 两个评测集,印地语成为该多语言榜单上的首个 Indic 语言。
Hugging Face 发布研究,提出三种测试量化 ASR 模型的基准优化(benchmaxxing)现象。评估 11 个开源模型发现,部分高分模型会复现 VoxPopuli 与 LibriSpeech 的错误参考文本、在音频中数字被静音时仍以约 30-40% 的比例输出该数字,并通过声学线索切换拼写以匹配基准期望;在模型训练截止后新采集的同源音频上,这些行为明显减弱。
推荐理由:研究用三种探针量化了语音识别中的基准优化行为,为选型者提供了超越公开基准 WER 的评估思路。
Hume 发布 Real World VoiceEQ 基准,基于超 100 万条人类评分,评估 40 多个专有与开源语音模型,覆盖 ASR、TTS、S2S 和语音理解的 15+ 维度、60+ 指标。评估发现 TTS 无一配置在八组能力中均进前五,语音模型听比说差,许多系统仍以转录文本为主而忽略语气、迟疑等副语言线索;部分模型疑似针对公开基准优化,SLM 自动评估仅适合明确任务,尚难替代人类听评。
Google Research 发布开放语音数据集 WAXAL,覆盖 27 种撒哈拉以南非洲语言,使用者超过 1 亿人、分布于 26 个国家。数据集包含约 1,846 小时经转写的自然语音(WAXAL-ASR,采用图像提示引发自发语音)和超过 565 小时高保真 TTS 录音,以 CC-BY-4.0 许可开放,由 Makerere 大学、加纳大学等非洲学术与社区组织主导采集。