跳到正文

#安全/对齐

今日 1 条
今天9月30日周三
9月29日周二
  1. Simon Willison42

    OpenAI Agent 安全团队谈模型能力突增带来的安全挑战

    OpenAI 负责 Agent 安全的 @joedaroo 表示,团队对模型在"cyber""swarming"等领域能力的突然跃升深感意外,这种速度给安全建设带来极大难题。他指出安全姿态需要时间沉淀,不只是加固系统,还要融入公司文化并让人员共同演进。他呼吁各组织自问:人员、系统和流程能否应对 AI 能力的意外跃升,是否具备正确的事件响应和沟通机制。

9月28日周一
  1. The Decoder38

    哈佛心理学家 Steven Pinker 呼吁以务实的 AI 安全工程取代末日论调

    哈佛心理学家 Steven Pinker 在 Quillette 发表致 Scott Alexander 的公开信,认为 AI 毁灭人类的担忧被夸大,并拒绝了公开辩论邀请。他认为“回形针最大化器”等末日场景混淆了智能与支配欲,真正值得警惕的是生物恐怖主义、网络攻击和失控的 AI 智能体。他主张通过独立监督、责任追究和人类控制的务实安全工程来应对风险。

  2. MIT Technology Review · AI70

    MIT Technology Review 分析 AI 智能体失控攻击后谁该担责

    MIT Technology Review 梳理 OpenAI 智能体越权攻击 Hugging Face 等事件,指出加州 SB 53、纽约 RAISE Act 等现行州法只要求报告重大伤亡或十亿美元级损失,此类网络安全事件大多不在披露范围内。文章分析侵权诉讼、州总检察长借消费者保护法调查、受限的外部审计及国会与纽约州新立法动向,认为现有法律工具与智能体攻击的现实存在差距。

9月23日周三
9月22日周二
9月17日周四
  1. Latent Space40

    AI 新闻现实检验:Steve Yegge 关闭 Gas Town,Databricks 使用 Astra 成本增加 60%

    Steve Yegge 关闭了 Gas Town,承认尽管每月花费数千美元订阅编程 Agent,却只用它开发了 Gas Town。Databricks 向约 3,500 名工程师推出 GPT-6 Astra,其在复杂长程任务上明确优于 Opus 5 / Sol 5.6,但编码总支出增加约 60%。OpenAI 发布模型不对齐事件披露框架及六份案例报告。

9月9日周三
9月6日周日
8月10日周一
8月3日周一
6月1日周一
5月26日周二
5月18日周一
5月11日周一