Hume 推出 Real World VoiceEQ 基准,衡量语音 AI 的人类级质量
Hume 发布 Real World VoiceEQ 基准,基于超 100 万条人类评分,评估 40 多个专有与开源语音模型,覆盖 ASR、TTS、S2S 和语音理解的 15+ 维度、60+ 指标。评估发现 TTS 无一配置在八组能力中均进前五,语音模型听比说差,许多系统仍以转录文本为主而忽略语气、迟疑等副语言线索;部分模型疑似针对公开基准优化,SLM 自动评估仅适合明确任务,尚难替代人类听评。
Hume 发布 Real World VoiceEQ 基准,基于超 100 万条人类评分,评估 40 多个专有与开源语音模型,覆盖 ASR、TTS、S2S 和语音理解的 15+ 维度、60+ 指标。评估发现 TTS 无一配置在八组能力中均进前五,语音模型听比说差,许多系统仍以转录文本为主而忽略语气、迟疑等副语言线索;部分模型疑似针对公开基准优化,SLM 自动评估仅适合明确任务,尚难替代人类听评。
Google Research 发布大型传感器基础模型 SensorFM,在 500 万名同意参与者的超过一万亿分钟多模态可穿戴信号上自监督预训练。模型输入 PPG、加速度计、EDA、皮温和测高五类模态共 34 个一分钟聚合特征,采用 AIM 框架直接从不完整数据中学习。
推荐理由:Google 自述其可穿戴基础模型的数据规模、AIM 缺失数据处理方法与下游结果,读者可了解可穿戴健康数据通用表示的可行路径。
Google Research 在 Nature Cities 发表首个大规模真实世界研究,测试用导航平台干预城市交通。团队修改 Google Maps 路由算法,在 10 个美国城市开展六个月的 city-wide switchback 实验,仅让不到 2% 的行程改走车程相近的替代路线。
Hugging Face 推出开源基准 ScarfBench,用于评测 AI 智能体在 Spring、Jakarta EE、Quarkus 三大 Java 生态间的框架迁移能力,包含 34 个应用、102 个框架实现、204 个迁移任务和 1,331 个专家编写测试。
Hugging Face 提出 DiScoFormer,单个 Transformer 通过一次前向传播即可估计任意数据集背后的分布密度与 score,无需针对新分布重训。
Google Research 在 CIDR 发表线性弹性缓存方法,把页面逐出建模为“滑雪租赁”问题,用轻量级机器学习动态调整缓存大小,以最小化缓存管理总拥有成本(TCO)。该方法已在 Spanner 生产服务器上集成数月,相比固定大小缓存,内存占用降低 15.5%,cache miss 仅增加 5.5%,TCO 约降 5%,实际 I/O 成本影响仅 0.5%。
Google Research 将在 COLM 2026 发表的论文发现,开启链式推理可让 Gemini-2.5(Flash 和 Pro)与 Qwen3-32B 召回推理关闭时几乎无法给出的单跳事实答案。
推荐理由:论文给出两类机制实验和幻觉审计结果,读者可以据此理解推理为何能帮助单跳事实召回以及其局限。
Import AI 第462期汇总多篇研究:牛津等机构四项实验共18,978次对话显示AI说服力稳定超过专家人类,Opus 4.1和Opus 4.6最强,真人募捐实验中AI比专业募捐者多筹10.8个百分点。
Google Research 公布了关于 AI 皮肤科信息工具的多项研究,发表于 JAMA Dermatology 等期刊。一项 2,345 人参与的实验显示,借助 AI 工具的用户病症识别准确率达 23%,约为普通搜索对照组(8%)的三倍;接近医生"ground truth"的 "Wizard of Oz" 组达 36%。
Google Research 在 AISTATS 2026 提出 Regularized f-Divergence Kernel Tests,一个用于审计机器遗忘的统计测试框架,比传统 two-sample testing 更灵敏灵活。
Google DeepMind 公布在塞拉利昂开展的预注册对照试验结果,使用 Guided Learning 的学生数学成绩较对照组提升 0.258 个标准差,约相当于 1.2 至 1.7 年的常规学习进度。
推荐理由:原文给出预注册RCT的关键数据和开放式材料,读者可以了解AI辅助教学在真实课堂中的效果与局限。
King's College London、复旦大学与 The Alan Turing Institute 等构建了 SocioHack 基准,含 72 个沙盒社会环境(历史 32 个。
Google 在 Nature 发表 PHRM 研究系统,利用人脸解锁后前置摄像头拍摄的面部视频,通过深度学习估计心率,较 ECG 的 MAPE 低于 10%。
推荐理由:原文给出跨肤色验证数据与公开数据集入口,读者可以据此了解手机摄像头被动心率监测的精度与局限。
Google DeepMind 推出分布式训练架构 Decoupled DiLoCo,将训练拆分为异步通信的计算“孤岛”(learner units),隔离硬件故障对整体训练的影响。
Google Research 在 ICLR 论文中提出 ReasoningBank,一个从成功与失败经验中提炼结构化推理记忆的智能体记忆框架,并配套 MaTTS 记忆感知测试时扩展方法。
Berkeley AI Research 等团队提出 GRASP,一种基于梯度的世界模型规划器,让长时程规划更实用。方法包括将轨迹提升到虚拟状态以实现跨时间并行的优化、在状态迭代中直接加入随机性以促进探索,并对梯度进行重塑以避开高维视觉模型中脆弱的 state-input 梯度。
Google Research 在 TMLR 论文中推出 Simula,一种 seedless、agentic 的“推理优先”合成数据生成框架,将数据集生成重构为机制设计问题,通过全局多样性、局部多样性、复杂化与双 critic 质量检查四个可控轴独立调控覆盖面、复杂度和质量。
Google Research 的 MoGen 模型用点云流匹配生成合成神经形态,加入 PATHFINDER 训练数据后使重建错误率降低 4.4%,主要减少 merge 错误。在完整小鼠大脑尺度上,这相当于节省 157 人年的手工校对工作。该研究将在 ICLR 2026 发表,MoGen 已开源。
Google Research 推出 ConvApparel 数据集,包含 4,000 多段服装购物领域的人机多轮对话(近 15,000 轮),用于量化 LLM 用户模拟器与真实人类行为的真实感差距。
Google Research 提出一个评估 LLM 行为倾向与人类对齐程度的框架,基于 IRI、ERQ 等心理学量表生成情景判断测试(SJT),比较模型与 550 名参与者(每个 SJT 10 名标注者)的偏好分布。
Google Research 在论文 "Forest vs Tree: The (N,K) Trade-off in Reproducible ML Evaluation" 中研究了评测基准中条目数量与每条标注者人数的权衡。
Google Quantum AI 团队在白皮书中更新了破解 ECDLP-256 的量子资源估算,给出两种 Shor 算法电路,分别使用不到 1,200 逻辑比特和 9,000 万 Toffoli 门、不到 1,450 逻辑比特和 7,000 万 Toffoli 门,并估计在超导量子计算机上以不到 50 万物理比特数分钟内完成,所需物理比特较此前估算降低约 20 倍。
Google 推出 TurboQuant 压缩算法(ICLR 2026),在零精度损失下大幅缩减模型体积,同时支持 KV cache 压缩和向量搜索。其核心依赖 QJL 的零开销 1-bit 技巧与 PolarQuant 的极坐标压缩,消除了传统向量量化每数字 1-2 bit 的内存开销。
Google Research 在 Earth AI 计划下推出 S2Vec,一个自监督框架,可将建筑环境转化为通用嵌入向量。它先用 S2 Geometry 将地球表面划分为分层 cell,再把特征栅格化为多层图像,并通过掩码自编码(MAE)无需人工标签地学习位置特征。
Google Research 与多家 NHS 机构合作开展 AIMS 研究,两项发表于 Nature Cancer 的研究评估 AI 乳腺癌检测系统。
推荐理由:Google 与 NHS 合作的两项 Nature Cancer 研究给出 AI 乳腺筛查的实测数据与人机工作流对比,读者可了解落地中的真实瓶颈。
Google Research 与 Cornell 合作在 PNAS 发表论文,让 GPT-4o、Perplexity、Claude 3.5、Gemini Advanced Pro 1.5、NotebookLM 和自建 RAG 系统回答 67 个铜氧化物高温超导专家问题,由专家按 0 到 2 分多指标盲评。
Berkeley AI Research 提出 SPEX 和 ProxySPEX 算法,利用稀疏性和低阶性等结构性质,以远少于传统方法的消融次数识别 LLM 中影响输出的特征、数据与内部组件交互。
Google Research 与 Beth Israel Deaconess Medical Center 合作开展 AMIE 对话式诊断 AI 的前瞻性单中心可行性研究,100 名成人患者在基层门诊就诊前与 AMIE 进行受监督的病史采集对话。
推荐理由:原文给出真实门诊环境中 AMIE 的安全性、诊断准确率和医患体验数据,读者可据此了解对话式医疗 AI 落地的实际证据。
Google Research 发布开放语音数据集 WAXAL,覆盖 27 种撒哈拉以南非洲语言,使用者超过 1 亿人、分布于 26 个国家。数据集包含约 1,846 小时经转写的自然语音(WAXAL-ASR,采用图像提示引发自发语音)和超过 565 小时高保真 TTS 录音,以 CC-BY-4.0 许可开放,由 Makerere 大学、加纳大学等非洲学术与社区组织主导采集。
Berkeley AI Research 团队在 NeurIPS 2025 论文中提出直接基于信息量评估和优化成像系统的框架,仅需噪声测量数据与噪声模型即可估计互信息。该指标在彩色摄影、射电天文、无透镜成像和显微成像四个领域预测下游解码器性能,其优化设计达到与 SOTA 端到端方法相当的效果,同时只需更少内存与算力,且无需任务特定的解码器设计。
Berkeley AI Research 介绍了一种基于“分而治之”的 off-policy RL 价值学习算法,替代 TD learning。传统 TD learning 的 Bellman 递归会使误差随长 horizon 累积,TD-n 只能按常数因子减少递归次数,而分而治之可将递归次数按对数级降低,且无需调超参数 n。
Berkeley AI Research 的新论文为 word2vec 的学习过程提供了定量预测理论:证明在若干温和近似条件下,其学习问题可归约为无加权最小二乘矩阵分解,梯度流动力学可解析求解,最终学到的表示等价于对特定目标矩阵 $M^\star$ 做 PCA。