跳到正文

#评测/基准

今日 0 条
9月2日周三
8月28日周五
8月17日周一
  1. Import AI36

    Import AI 469:科学 AI、RSI 模拟器与 Zuck 的技术悲观主义

    DiG-bench 发布,一个由 70 款隐藏规则游戏组成的基准,测试模型通过探索发现环境规则的能力。Opus 5 和 Fable 5(配合 Claude Code)表现最好,是仅有的能在最难的 Tier 7 得分(0.2)的模型,但远低于人类 100% 的成绩。Inherent 则发布 Faraday,用较小的开源权重模型监督前沿模型做科学研究。

8月13日周四
  1. Microsoft Research41

    Microsoft Research 推出 MindTopo 基准,测试多模态模型的拓扑推理能力

    Microsoft Research 发布 MindTopo 基准,评估多模态大语言模型对连续性、分离、顺序、封闭和绳结五类拓扑概念的理解,涵盖静态推理与交互规划两个层级。测试显示,专有与开源模型在静态识别上明显优于交互式规划任务,且均远低于人类水平,错误多出现在规划阶段丢失结构关系。图像与视频生成工具仅在单帧内偶尔有帮助,难以在多步操作中保持拓扑约束。

7月15日周三
  1. Hugging Face Blog51

    Hume 推出 Real World VoiceEQ 基准,衡量语音 AI 的人类级质量

    Hume 发布 Real World VoiceEQ 基准,基于超 100 万条人类评分,评估 40 多个专有与开源语音模型,覆盖 ASR、TTS、S2S 和语音理解的 15+ 维度、60+ 指标。评估发现 TTS 无一配置在八组能力中均进前五,语音模型听比说差,许多系统仍以转录文本为主而忽略语气、迟疑等副语言线索;部分模型疑似针对公开基准优化,SLM 自动评估仅适合明确任务,尚难替代人类听评。

7月1日周三
4月1日周三