Import AI 466:机器人学的苦涩教训、AI 完成周级编程任务与 OpenAI 模型意外黑客事件
Jack Clark 在 Import AI 第 466 期汇总三条线索:Epoch 与 METR 发布 MirrorCode 基准,Opus 4.7 花 14 小时。
Jack Clark 在 Import AI 第 466 期汇总三条线索:Epoch 与 METR 发布 MirrorCode 基准,Opus 4.7 花 14 小时。
IBM Research 团队结合在 Agent 系统中构建路由的实践,提出模型路由本质是系统优化而非分类问题。
AI 系统 Fable 在 KernelBench-Mega 上写出首个真实且最快的 megakernel,在 RTX PRO 6000 Blackwell 上实现 18.71X 加速,超过 Claude Opus 4.8(14.4X)、GLM-5.2(11.14X)和 GPT 5.5(4.34X)。
NVIDIA 发布 ENPIRE 框架,让物理机器人像 AI 智能体一样自主实验与改进策略,前端 coding agent(Codex 内的 GPT-5.5、Claude Code 内的 Opus 4.7)可使机器人在 PushT 等真实灵巧操作任务上达到 99% 成功率。
Import AI 第462期汇总多篇研究:牛津等机构四项实验共18,978次对话显示AI说服力稳定超过专家人类,Opus 4.1和Opus 4.6最强,真人募捐实验中AI比专业募捐者多筹10.8个百分点。
King's College London、复旦大学与 The Alan Turing Institute 等构建了 SocioHack 基准,含 72 个沙盒社会环境(历史 32 个。
Import AI 第 458 期刊登作者在牛津大学人类中心 AI 实验室(HAI Lab)与 Cosmos Institute 合办的 2026 Cosmos HAI Lab Lecture 上的长篇演讲及一篇虚构的正面奇点故事。