ProvenanceGuard:面向 MCP 智能体的来源感知事实性验证
Hugging Face 团队提出 ProvenanceGuard,一个针对基于 MCP 的 LLM 智能体的生成后验证层,能检测“跨来源混淆”——事实存在但被归因到错误来源的情况。
Hugging Face 团队提出 ProvenanceGuard,一个针对基于 MCP 的 LLM 智能体的生成后验证层,能检测“跨来源混淆”——事实存在但被归因到错误来源的情况。
IBM Research 在开源工具 ALTK-Evolve 中新增一致性指南与 Consistency Analyzer,针对平均准确率掩盖的可靠性问题。
Voice Arena 与 Hugging Face 合作,在 Open ASR Leaderboard 中引入 Monsoon en-IN 和 Monsoon hi-IN 两个评测集,印地语成为该多语言榜单上的首个 Indic 语言。
Multiverse Computing 发布论文 Quantization-Aware Healing,提出 QAH 方法:直接从压缩前的原始模型蒸馏,修复经过结构压缩并量化到 MXFP4 的模型。
Hugging Face 发布研究,提出三种测试量化 ASR 模型的基准优化(benchmaxxing)现象。评估 11 个开源模型发现,部分高分模型会复现 VoxPopuli 与 LibriSpeech 的错误参考文本、在音频中数字被静音时仍以约 30-40% 的比例输出该数字,并通过声学线索切换拼写以匹配基准期望;在模型训练截止后新采集的同源音频上,这些行为明显减弱。
推荐理由:研究用三种探针量化了语音识别中的基准优化行为,为选型者提供了超越公开基准 WER 的评估思路。
Multiverse Computing 发布论文,用缓存教师模型 top-100 logits 的离线蒸馏和融合分块 KL 损失两项系统改动降低知识蒸馏成本。
Hugging Face 推出开源基准 ScarfBench,用于评测 AI 智能体在 Spring、Jakarta EE、Quarkus 三大 Java 生态间的框架迁移能力,包含 34 个应用、102 个框架实现、204 个迁移任务和 1,331 个专家编写测试。