跳到正文

#评测/基准

今日 1 条
今天9月30日周三
9月28日周一
9月22日周二
9月16日周三
9月2日周三
8月28日周五
8月27日周四
  1. Google DeepMind54

    Google DeepMind 试点全球首个专有前沿模型双盲评估

    Google DeepMind 推出全球首个针对专有前沿 AI 模型的双盲评估,将外部评测限制在密码学安全的隔离环境中,防止模型提前接触测试题造成基准污染。Gemini Flash Lite 模型将与 Singapore AI Safety Institute、OpenMined、AVERI 和 MLCommons 合作,在隐私保护环境下测试机密基准。

8月17日周一
  1. Import AI36

    Import AI 469:科学 AI、RSI 模拟器与 Zuck 的技术悲观主义

    DiG-bench 发布,一个由 70 款隐藏规则游戏组成的基准,测试模型通过探索发现环境规则的能力。Opus 5 和 Fable 5(配合 Claude Code)表现最好,是仅有的能在最难的 Tier 7 得分(0.2)的模型,但远低于人类 100% 的成绩。Inherent 则发布 Faraday,用较小的开源权重模型监督前沿模型做科学研究。

8月13日周四
  1. Hugging Face Blog76

    Hugging Face 复盘 ICML 2026 论文复现挑战赛:1,221 人复现 2,226 篇论文

    Hugging Face 复盘今年 7 月 15 日至 8 月 2 日举办的 ICML 2026 Open Reproductions 挑战赛:1,221 名社区成员用 Claude Code、Codex、Cursor 等智能体,19 天发布 6,816 份 Trackio 日志,尝试复现 2,226 篇论文,约占会议论文的 34%。

    推荐理由:文中给出按声明逐条复核会议论文的结果分布和典型的证伪案例,读者可以借此理解智能体复现研究中人类角色的边界。

7月16日周四
  1. Hugging Face Blog30

    DharmaOCR 如何以领域专精持续领先新发布的 Mistral OCR4 与 Unlimited-OCR

    DharmaOCR 在巴西葡萄牙语 OCR 基准上以 0.925 的得分领先新模型 Mistral OCR4(0.798)和 Unlimited-OCR(0.7587),证明领域专精的优势依然成立。该模型先通过葡萄牙语文档监督微调对齐词汇与文档结构,再用 DPO 从偏好数据中学习以降低输出退化率和推理成本。专项化训练使全部参数集中于单一语言,这一结构性取舍构成了对多语言模型的可量化优势。

7月15日周三
  1. Hugging Face Blog51

    Hume 推出 Real World VoiceEQ 基准,衡量语音 AI 的人类级质量

    Hume 发布 Real World VoiceEQ 基准,基于超 100 万条人类评分,评估 40 多个专有与开源语音模型,覆盖 ASR、TTS、S2S 和语音理解的 15+ 维度、60+ 指标。评估发现 TTS 无一配置在八组能力中均进前五,语音模型听比说差,许多系统仍以转录文本为主而忽略语气、迟疑等副语言线索;部分模型疑似针对公开基准优化,SLM 自动评估仅适合明确任务,尚难替代人类听评。

7月6日周一
7月1日周三
6月30日周二
4月1日周三