20 多位顶尖 AI 研究者联名警告自动化 AI 研究带来极端风险
20 多位 AI 研究者包括 Geoffrey Hinton、Yoshua Bengio 和 OpenAI 研究负责人 Jakub Pachocki 在新论文中警告自我改进 AI 可能引发智能爆炸。
20 多位 AI 研究者包括 Geoffrey Hinton、Yoshua Bengio 和 OpenAI 研究负责人 Jakub Pachocki 在新论文中警告自我改进 AI 可能引发智能爆炸。
OpenAI 推出 MentalHealthBench,这是一个由专家参与构建的基准,用于评估 AI 在真实心理健康对话场景中回应的有用性与安全性。
RAND 发布长篇报告,认为美国在通往 superintelligence 的不确定路径上应采取“自由行动”战略,现阶段花钱保留所有选项。报告归纳了 Coexistence、Denial、Acceleration 三大类共七种原型战略,并列出危险临近程度、共存可行性、克制可行性、决定性战略优势和压制可行性五大关键不确定性。本期还报道了研究者在小鼠幼崽体内培育部分人类脑组织的工作。
Hugging Face 推出 BenchMIRT,一种基于多维 Item Response Theory 的方法,可在单个题目层面审计 LLM 基准测试实际测量的能力。
Jack Clark 在 Import AI 第 466 期汇总三条线索:Epoch 与 METR 发布 MirrorCode 基准,Opus 4.7 花 14 小时。
Google Research 在 AISTATS 2026 提出 Regularized f-Divergence Kernel Tests,一个用于审计机器遗忘的统计测试框架,比传统 two-sample testing 更灵敏灵活。
King's College London、复旦大学与 The Alan Turing Institute 等构建了 SocioHack 基准,含 72 个沙盒社会环境(历史 32 个。
Google Research 提出一个评估 LLM 行为倾向与人类对齐程度的框架,基于 IRI、ERQ 等心理学量表生成情景判断测试(SJT),比较模型与 550 名参与者(每个 SJT 10 名标注者)的偏好分布。