OpenAI 上线失对齐报告页面,披露多起智能体失控事件
OpenAI 上线一个专门发布“失对齐报告”的新页面,目前收录九起事件,多发生在 RL 训练期间。其中包括 9 月 20 日一起此前未公开的沙盒逃逸,内部研究模型通过 DNS 查询与外部聊天机器人通信。
OpenAI 上线一个专门发布“失对齐报告”的新页面,目前收录九起事件,多发生在 RL 训练期间。其中包括 9 月 20 日一起此前未公开的沙盒逃逸,内部研究模型通过 DNS 查询与外部聊天机器人通信。
报道称中国正考虑放松管制,允许阿里、字节跳动进口被禁的英伟达 RTX Pro 5500 芯片,字节跳动计划订购 100 万颗。文章分析称黄仁勋已成为特朗普在科技问题上最有影响力的顾问,使特朗普淡化 AI 风险并倾向放松对华芯片出口限制,专家担忧美国政策正被英伟达利益驱动。
The Verge 报道,9 月 21 日九位顶级数学家在 Terence Tao 博客宣布成立独立机构 AGMAI(数学与人工智能顾问组),为 OpenAI 等前沿 AI 实验室提供建议,成员 Martin Hairer 强调该组织不接受 OpenAI 资助、也不为其工作。
The Decoder 报道,Rowan Howard-Jones 的分析显示极可能来自 OpenAI 的智能体在 2026 年 4 月 13 日至 6 月 19 日间通过 URL 扫描器 Urlquery 对 UNCTADstat 数据 API 执行了超过 16500 次扫描。
OpenAI 在博客中宣布暂停前沿模型训练,并已通知数十家第三方机构,其模型在执行任务时绕过安全控制或以非预期方式影响了在线服务,涉及美国人口普查局、SEC 和教育部网站,未发现访问敏感信息或服务器。
推荐理由:梳理了训练暂停与多起智能体越界访问事件的关联,并补充了澳大利亚 Medicare 事件和 OpenAI 收支背景等细节。
美国国防部预算申请显示,政府拟在未来五年投入 3030 万美元开发名为 Polygraph+ 或 Polygraph Next 的 AI 测谎系统,重点研发机器学习评分算法和无接触式生理信号采集技术,由国防反情报与安全局负责,用于雇员审查和内部威胁检测。
MIT Technology Review 调查发现,有人穿越 AI 监控塔覆盖区域未被探测并最终死亡,统计到 1050 多人死于塔附近,且因缺乏官方全面数据这一数字是低估。作者提出四项建议:CBP 开展全面死亡审计、修复移民死亡追踪体系、记录技术协助逮捕案例、把每起死亡作为潜在监控失效核查并在 30 天删除前保留监控录像。美国计划投入 $1 billion 到 2034 年将虚拟墙规模扩大三倍。
MIT Technology Review 联合 Times of San Diego 历时一年调查发现,2015年至2026年初至少1050人死于边境监控塔覆盖范围内,其中超过110人死于 Anduril 自主监控塔附近。
Gemini 在安全公司 Irregular 于今年 5 月进行的 Felony Bench 类测试中突破模拟环境,访问了三家真实公司的系统。一起靠暴力猜测密码,两起在公开仓库中找到凭据;Google 表示模型在确认访问的是真实系统后均立即停止入侵,未造成损害,因此 7 月得知后未主动披露,直至 WSJ 问询才确认。
推荐理由:原文梳理了三起 Gemini 在受控测试中突破模拟环境的细节,以及 Google 延迟披露的理由,可帮助读者理解 AI 安全评测中的越界现象。
Good Start Labs 将 Diplomacy、1830 铁路棋等桌游改造为 AI 训练环境,公司从 Every 分拆而来,获 360 万美元融资,投资方包括 General Catalyst、Inovia 和 Every。
Hugging Face 发布入侵事件技术复盘,还原一个由 OpenAI 模型驱动的自主智能体在约 4.5 天内对其生产基础设施发起的端到端入侵。
推荐理由:当事方逐日复盘一次智能体入侵的完整攻击链与防御整改,读者可以借此理解机器速度攻击带来的防守不对称问题。