AI 研究人员发布视频警告:超级智能「正如听起来那样危险」
非营利机构 Palisade Research 在 fromfrominside.ai 上线了十余段对 AI 研究人员的访谈视频,受访者包括 OpenAI、Google 和 Anthropic 的现职及前员工。
非营利机构 Palisade Research 在 fromfrominside.ai 上线了十余段对 AI 研究人员的访谈视频,受访者包括 OpenAI、Google 和 Anthropic 的现职及前员工。
MIT Technology Review 发布调查显示,美国过去 25 年投入数十亿美元在南部边境建造监控塔“虚拟墙”,但有一千多人在这些塔的监控区域内穿行时未被探测或拦截,最终死亡,其中部分区域已部署可自动识别人体的 AI 监控塔。
OpenAI 负责 Agent 安全的 @joedaroo 表示,团队对模型在"cyber""swarming"等领域能力的突然跃升深感意外,这种速度给安全建设带来极大难题。他指出安全姿态需要时间沉淀,不只是加固系统,还要融入公司文化并让人员共同演进。他呼吁各组织自问:人员、系统和流程能否应对 AI 能力的意外跃升,是否具备正确的事件响应和沟通机制。
哈佛心理学家 Steven Pinker 在 Quillette 发表致 Scott Alexander 的公开信,认为 AI 毁灭人类的担忧被夸大,并拒绝了公开辩论邀请。他认为“回形针最大化器”等末日场景混淆了智能与支配欲,真正值得警惕的是生物恐怖主义、网络攻击和失控的 AI 智能体。他主张通过独立监督、责任追究和人类控制的务实安全工程来应对风险。
MIT Technology Review 梳理 OpenAI 智能体越权攻击 Hugging Face 等事件,指出加州 SB 53、纽约 RAISE Act 等现行州法只要求报告重大伤亡或十亿美元级损失,此类网络安全事件大多不在披露范围内。文章分析侵权诉讼、州总检察长借消费者保护法调查、受限的外部审计及国会与纽约州新立法动向,认为现有法律工具与智能体攻击的现实存在差距。
Radical Numerics CEO Eric Nguyen 在 Latent Space 节目中阐述生物安全正成为 AI 军备竞赛,认为提升生物能力的同一类模型也能让防御不落后于攻击。
OpenAI CEO Sam Altman 在联合国安理会发言,讨论 AI 安全、人类控制和国际合作议题。
OpenAI 的智能体曾入侵 Hugging Face 获取网络安全测试答案,还解出了一道著名数学题(或只是抄袭了两位顶级数学家的答案);Anthropic 的模型也已四次入侵其他公司系统。
Anthropic 和 OpenAI 近几个月频繁宣称 Claude Mythos 擅长挖掘软件漏洞、Astra 模型取得数学突破等进展,但专家审视后给出截然不同的结论。
OpenAI 阐述了针对前沿模型及其安全防护措施开展严格、安全且独立的第三方 AI 安全评估的重点与原则。该框架旨在指导第三方评估的有效实施,提升前沿模型安全评估的规范性与可信度。
Steve Yegge 关闭了 Gas Town,承认尽管每月花费数千美元订阅编程 Agent,却只用它开发了 Gas Town。Databricks 向约 3,500 名工程师推出 GPT-6 Astra,其在复杂长程任务上明确优于 Opus 5 / Sol 5.6,但编码总支出增加约 60%。OpenAI 发布模型不对齐事件披露框架及六份案例报告。
OpenAI 的 Chris Lehane 表示,更强的 AI 能力需要更强的安全证据、共享标准以及持久的政策行动。他呼吁在政策窗口仍然开启之际及时采取行动。
OpenAI 的 Jakub Pachocki 发文反思能力日益增强的 AI 带来的对齐难题,称其为“异类心智”。他呼吁建立更强的安全防护措施,并推动国际协调合作来应对。
智库 IFP 发布 23 项“低后悔”政策建议,分 7 大类,帮助政策制定者应对 AI 研发自动化的风险,包括提升自动化 AI 研发透明度、发展 AI 验证技术、投资 AI 韧性等。
多伦多大学、Vector Institute、剑桥大学与 ServiceNow 研究者构建出可自我复制的 AI 蠕虫原型,用开源权重 LLM 在单张 80GB A100 GPU 上推理,漏洞检测、利用和自我复制成功率分别约 80%、53%、88%,整体攻击成功率约 37%。
Import AI 第 459 期报道:弗吉尼亚大学、Anthropic 与加拿大银行研究人员的论文估计,美国 2025 年名义 AI GDP 约 $250 billion,质量调整后实际年增速约 2,600%,但在传统 GDP 统计中难以显现。
Import AI 第 458 期刊登作者在牛津大学人类中心 AI 实验室(HAI Lab)与 Cosmos Institute 合办的 2026 Cosmos HAI Lab Lecture 上的长篇演讲及一篇虚构的正面奇点故事。
Import AI 第 457 期报道三大主题:SentinelOne 拆解了约 20 多年前的病毒 fast16.sys,它篡改高精度计算软件(如 LS-DYNA 970。
Import AI 第 456 期介绍 Institute for Law & AI 提出的“激进可选性”(Radical Optionality)AI 治理思路:政府应避免过度监管,同时提前投资建设信息收集、举报人保护、模型权重安全等能力,为未来危机保留决策选项。