跳到正文

#评测/基准

今日 0 条
9月28日周一
9月22日周二
9月16日周三
9月2日周三
8月28日周五
8月27日周四
  1. Google DeepMind54

    Google DeepMind 试点全球首个专有前沿模型双盲评估

    Google DeepMind 推出全球首个针对专有前沿 AI 模型的双盲评估,将外部评测限制在密码学安全的隔离环境中,防止模型提前接触测试题造成基准污染。Gemini Flash Lite 模型将与 Singapore AI Safety Institute、OpenMined、AVERI 和 MLCommons 合作,在隐私保护环境下测试机密基准。

8月13日周四
  1. Hugging Face Blog76

    Hugging Face 复盘 ICML 2026 论文复现挑战赛:1,221 人复现 2,226 篇论文

    Hugging Face 复盘今年 7 月 15 日至 8 月 2 日举办的 ICML 2026 Open Reproductions 挑战赛:1,221 名社区成员用 Claude Code、Codex、Cursor 等智能体,19 天发布 6,816 份 Trackio 日志,尝试复现 2,226 篇论文,约占会议论文的 34%。

    推荐理由:文中给出按声明逐条复核会议论文的结果分布和典型的证伪案例,读者可以借此理解智能体复现研究中人类角色的边界。

  2. Microsoft Research41

    Microsoft Research 推出 MindTopo 基准,测试多模态模型的拓扑推理能力

    Microsoft Research 发布 MindTopo 基准,评估多模态大语言模型对连续性、分离、顺序、封闭和绳结五类拓扑概念的理解,涵盖静态推理与交互规划两个层级。测试显示,专有与开源模型在静态识别上明显优于交互式规划任务,且均远低于人类水平,错误多出现在规划阶段丢失结构关系。图像与视频生成工具仅在单帧内偶尔有帮助,难以在多步操作中保持拓扑约束。

7月16日周四
  1. Hugging Face Blog30

    DharmaOCR 如何以领域专精持续领先新发布的 Mistral OCR4 与 Unlimited-OCR

    DharmaOCR 在巴西葡萄牙语 OCR 基准上以 0.925 的得分领先新模型 Mistral OCR4(0.798)和 Unlimited-OCR(0.7587),证明领域专精的优势依然成立。该模型先通过葡萄牙语文档监督微调对齐词汇与文档结构,再用 DPO 从偏好数据中学习以降低输出退化率和推理成本。专项化训练使全部参数集中于单一语言,这一结构性取舍构成了对多语言模型的可量化优势。

7月15日周三
  1. Hugging Face Blog51

    Hume 推出 Real World VoiceEQ 基准,衡量语音 AI 的人类级质量

    Hume 发布 Real World VoiceEQ 基准,基于超 100 万条人类评分,评估 40 多个专有与开源语音模型,覆盖 ASR、TTS、S2S 和语音理解的 15+ 维度、60+ 指标。评估发现 TTS 无一配置在八组能力中均进前五,语音模型听比说差,许多系统仍以转录文本为主而忽略语气、迟疑等副语言线索;部分模型疑似针对公开基准优化,SLM 自动评估仅适合明确任务,尚难替代人类听评。

7月1日周三
6月30日周二
4月1日周三