OpenAI 就澳大利亚政府网站事件致歉并承诺改进安全防护
OpenAI 就涉及澳大利亚政府网站的事件公开致歉,并表示将推出更强的安全防护措施与支持,以加强澳大利亚的网络防御能力。
OpenAI 就涉及澳大利亚政府网站的事件公开致歉,并表示将推出更强的安全防护措施与支持,以加强澳大利亚的网络防御能力。
OpenAI 发布针对前沿 AI 训练的安全案例早期指南,内容涵盖技术防护措施、运营实践,以及模型不对齐事件的调查方法。该指南旨在为评估前沿模型训练安全提供框架参考。
OpenAI CEO Sam Altman 在联合国安理会发言,讨论 AI 安全、人类控制和国际合作议题。
OpenAI 推出 MentalHealthBench,这是一个由专家参与构建的基准,用于评估 AI 在真实心理健康对话场景中回应的有用性与安全性。
OpenAI 阐述了针对前沿模型及其安全防护措施开展严格、安全且独立的第三方 AI 安全评估的重点与原则。该框架旨在指导第三方评估的有效实施,提升前沿模型安全评估的规范性与可信度。
OpenAI 提出建立共享的全球 AI 标准的路径,呼吁通过协调一致的评估、报告和治理机制来提升 AI 安全。该方案强调国际协作,为 AI 进入下一发展阶段制定共同规范。
OpenAI 发布澳大利亚青少年安全蓝图(Australian Youth Safety Blueprint),这是一份包含六大支柱的路线图,旨在打造更安全的 AI 体验,保护并赋能青少年。
OpenAI 发布了一套用于跟踪、调查和披露模型不对齐问题的框架,并同步公布六份关于模型意外或异常行为的报告。该框架旨在让此类行为问题的处理流程更加规范透明。
OpenAI 宣布 Paul Christiano 加入 OpenAI 基金会董事会及其安全与安保委员会。官方称他将带来在 AI 对齐、安全和标准方面的经验。
推荐理由:官方宣布 Paul Christiano 加入 OpenAI 基金会董事会及其安全委员会,读者可据此关注其对安全方向的可能影响。
OpenAI 的 Chris Lehane 表示,更强的 AI 能力需要更强的安全证据、共享标准以及持久的政策行动。他呼吁在政策窗口仍然开启之际及时采取行动。
OpenAI 推出一项总额 500 万美元的资助计划,面向独立研究开放申请,研究生成式 AI 对青少年发展、身心健康与安全的影响。项目现已开放申请。
OpenAI 的 Jakub Pachocki 发文反思能力日益增强的 AI 带来的对齐难题,称其为“异类心智”。他呼吁建立更强的安全防护措施,并推动国际协调合作来应对。
OpenAI 推出 Daybreak for Frontline Defenders 计划,承诺投入 $1B,扩大基础服务对前沿网络安全 AI 的获取,并提供相关培训与支持。
Hugging Face 推出 BenchMIRT,一种基于多维 Item Response Theory 的方法,可在单个题目层面审计 LLM 基准测试实际测量的能力。
Mistral 发布 3B 开源权重多模态安全分类器 Shieldstral,将内容审核建模为策略自适应的问答任务,在推理时接受自然语言策略并输出校准的安全分数。该模型在文本安全上匹敌最大 7 倍于其体量的开放护栏模型,在多模态审核上创造新 SOTA,以 Apache 2.0 协议开放权重,可在单张 16GB GPU 上运行。
推荐理由:原文给出把内容审核改写成策略自适应问答的建模思路和数据构建方法,对做安全分类器的团队有可迁移的参考价值。
Hugging Face 发布入侵事件技术复盘,还原一个由 OpenAI 模型驱动的自主智能体在约 4.5 天内对其生产基础设施发起的端到端入侵。
推荐理由:当事方逐日复盘一次智能体入侵的完整攻击链与防御整改,读者可以借此理解机器速度攻击带来的防守不对称问题。
Google DeepMind 发布基于 3.5 Flash 微调的轻量网络安全模型 Gemini 3.5 Flash Cyber,用于发现、验证和修补漏洞。
Google DeepMind 与 Isomorphic Labs 发布联合生物韧性方案,从预防、检测、响应三方面防止模型被滥用并加速应对疫情。过去 12 个月已推进超过 15 项与政府、生物安全机构和研究组织的合作。
Hugging Face 披露本周检测并处置了一起由自主 AI 智能体系统端到端驱动的入侵,攻击者通过恶意数据集利用两条代码执行路径获得处理节点访问权限,窃取了部分内部数据集和多项服务凭证。
推荐理由:披露一起由自主智能体发起的入侵及 AI 取证应对细节,读者可以了解防御侧如何在护栏限制下自建可用模型能力。
Google DeepMind 发布 AI Control Roadmap,把内部 AI 智能体视为潜在未对齐的"内部威胁",在模型对齐之上增加系统级安全保障。
推荐理由:官方详细公开其纵深防御的 AI 控制路线图,包含威胁建模、监测指标和已落地的监控原型细节,可供安全实践参考。
Google Research 在 AISTATS 2026 提出 Regularized f-Divergence Kernel Tests,一个用于审计机器遗忘的统计测试框架,比传统 two-sample testing 更灵敏灵活。
Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA,并由 Google.org 支持,发起面向全球研究者的多智能体 AI 安全研究资助,金额最高 1000 万美元。
Google Research 推出面向隐私分析服务的高效密码学聚合新方案,遵循零信任原则,结合新型密码学协议与 TEE 硬件防护。该协议支持设备以单条一次性消息安全提交数据,无需多轮交互保持在线;密码学层可证明保证 Google 只能获得匿名化聚合结果,TEE attestation 则向所有参与者提供协议按公开代码正确执行的可验证证明。
Google DeepMind 宣布与新加坡政府建立新的国家级 AI 合作,涵盖医疗、教育、科研与可持续领域。
Google Research 提出一个评估 LLM 行为倾向与人类对齐程度的框架,基于 IRI、ERQ 等心理学量表生成情景判断测试(SJT),比较模型与 550 名参与者(每个 SJT 10 名标注者)的偏好分布。