OpenAI DevDay 2026 回顾:GPT-6 Astra 等 20 余项发布
OpenAI DevDay 2026 带来超过 20 项发布,包括 GPT-6 Astra、ChatGPT、Codex、API 更新、安全能力以及面向开发者的新工具。
OpenAI DevDay 2026 带来超过 20 项发布,包括 GPT-6 Astra、ChatGPT、Codex、API 更新、安全能力以及面向开发者的新工具。
OpenAI 的 GPT-6.1 Sol 在 Amazon Bedrock 正式可用,是 GPT-6 Sol 的重大升级。
推荐理由:官方发布说明了模型在代理编码等任务上的成本与性能对比,以及 Bedrock 上的安全与数据保留配置,便于评估落地。
OpenAI 发布 GPT-6.1 Sol,定位为接近 Astra 智能水平的模型,覆盖编码、计算机使用和专业工作场景,API 输入和输出 token 价格为 Astra 标准价的五分之一。
推荐理由:官方明确了 GPT-6.1 Sol 的定位与价格对比,读者可以直接评估在编码和计算机使用场景下的成本替代空间。
OpenAI 发布 GPT-6.1 Sol,称其在 agentic 编码、计算机使用和办公任务上接近 GPT-6.1 Astra,成本约为五分之一,API 定价为每百万输入 token $2、输出 $10、缓存输入 $0.10。
推荐理由:原文汇总了 Sol 的定价、基准成绩与 Astra 因安全问题推迟的背景,读者可据此权衡性价比与安全取舍。
OpenAI 在 DevDay 2026 宣布多项开发者产品更新。Codex 新增可复用云环境、语音控制、重做的 CLI、ChatGPT 桌面端代码审查视图,以及可按需或定时扫描 GitHub 仓库并持续检查新提交的 Codex Security Cloud,云版用户可直接使用 Daybreak Blue 防御模型。
OpenAI 在 Dev Day 宣布为软件工程智能体 Codex 推出可复用、可配置的云端开发环境,可从电脑、手机或云端访问,帮助任务更快启动并为团队提供共享工作区。
OpenAI 在 DevDay 上发布 GPT-6.1 Sol,称其在 agentic 编程、电脑操作和专业工作上接近 GPT-6 Astra,标准输入输出 token 价格为其五分之一。
推荐理由:原文给出 GPT-6.1 Sol 与 GPT-6 Astra 的价格和性能对比,并说明 GPT-6.1 Astra 因安全原因取消,读者可据此评估选用。
Meta 推出 Meta Enterprise Platform,向企业销售 AI 工具,首发包括 Muse 智能体、Meta Business Agent、Muse API 和 Muse Code。
Anthropic 发布中档模型 Sonnet 5.5,称其比前代 Sonnet 5 快 30%,token 消耗显著更低。官方基准显示其在智能体编码上优于 Opus 5.5,网络攻防能力与 Opus 5 相当,因此成为首个适用 Fable 和 Opus 同等网络安全防护的 Sonnet 模型;新版 Haiku 预计未来几周内发布。
Latent Space 发布 9/24-9/25 的 AI 新闻综述,核心是 Claude Opus 5.5 发布后社区反响积极,SimpleBench 以 88.4% 领先,并被大量用于纯代码生成解说视频和动画。
Latent Space 播客邀请 Anthropic 的 Thariq Shihipar 深谈 Claude Code 的现状与演进,涵盖 agentic coding 一年内从争议成为默认方式、提示词仍是高杠杆技能、artifacts 作为持久生成式接口,以及云大脑加本地双手的架构分离。
Anthropic 发布 Claude Sonnet 5.5,官方称运行快 30% 以上、多数工作成本最多低 30%,定价与 Sonnet 5 相同且各项基准全面超越。作者实测发现其编码能力接近 Opus 5.5,且它现已成为 claude.ai 免费档所用模型,而 ChatGPT 免费档用的是 Luna 5.6。此外公告重申 Haiku 5.5 将在未来几周内可用。
AWS 宣布 Claude Sonnet 5.5 可在 Amazon Bedrock 和 Claude Platform on AWS 使用,主打专注编码与知识工作,多数任务单次成本更低、速度更快。
推荐理由:原文给出 Sonnet 5.5 在 Bedrock 的能力变化、与 Opus 5.5 的分工建议和接入步骤,可据此规划工程工作流。
Anthropic 发布 Claude 5.5 系列第二款模型 Claude Sonnet 5.5,输出速度提升超过 30%,因每任务使用更少 token,实际成本最多下降 30%,多项基准接近 Opus 5.5。
推荐理由:汇总了 Sonnet 5.5 各基准分数、每任务成本变化和高风险网络安全防护细节,便于与 Opus 5.5 及 OpenAI 对位模型做成本比较。
OpenAI 正在征集开发者和研究者使用 Codex 创造的真实故事,邀请他们加入下一期 Codex Originals 计划。感兴趣的用户可提交自己的故事和项目参与。
Simon Willison 在 WeAreDevelopers World Congress North America 闭幕演讲中,用三张鸮鹦鹉照片和一段提示词让 Claude Opus 5.5 生成含 20 只以上鸮鹦鹉、带彩带和迪斯科球效果的像素艺术动画页面。
Proaction 使用 Codex、GPT-Live-1 和 GPT-6 Astra 更快地构建、运营和销售现代车队管理方案,销售增长 60%,并节省 75+ 小时。
Simon Willison 称,与编码智能体共事越久,越确信它们让软件工程变得更难。他承认用它们能做出令人惊叹的事情,但释放其全部潜力需要极高的纪律性和知识。
GitHub Copilot 团队认为聊天不是与 AI 交互的正确界面,介绍了 GitHub Copilot app 中的 canvas 功能,它是可与应用内 agent 双向通信的全栈小程序。作者用 Connect 4 游戏、Winget 包管理、SQLite 操作和自动化开发工作流等示例说明,与其让 agent 处理每次交互浪费 token,不如让它构建一个后续交互免费的自定义工具。
GitHub Security Lab 的 Antonio Morales 发布 Fuzzing Taskflow,一个基于 Taskflow Agent 的自主模糊测试流水线,只需提供 GitHub 仓库即可自动识别入口点、编写 harness、运行 AFL++、改进覆盖并分诊崩溃。
推荐理由:原文详述了用 LLM Agent 自动写 harness、跑 AFL、追覆盖缺口和分诊崩溃的完整流水线设计,可直接复用。
OpenCode 是一个开源的终端原生 AI 编程智能体,用 Go 编写,可读取编辑文件、执行 shell 命令,并连接包括 Amazon Bedrock 在内的 75+ 家 LLM 提供商。
AINews 本期以 Claude Opus 5.5 发布为主题:该模型官方称多数任务达到 Fable 5.1 水平、比 Opus 5 便宜 40% 运行成本,成为 Claude Code 和 Claude 应用的新默认模型,Sonnet 5.5 与 Haiku 5.5 将在未来数周跟进。
推荐理由:这期汇编梳理了 Claude Opus 5.5 与 GPT-6 Sol/Luna 同日发布的价格与评测分歧,包括高 token 用量抵消降价的成本拆解,便于读者对比两家宣传口径。
Simon Willison 将与 Jesse Vincent 于 10 月 14 日(周三)在旧金山共同举办一场关于 Agentic Engineering 的晚间 Birds of a Feather 聚谈会,面向用 coding agents 构建有趣项目的人。活动采取非正式 show-and-tell 形式,鼓励但不强制分享,尤其欢迎未公开讨论过的实验和未完成项目,明确排除产品推销。
Airbnb 扩大了员工对 GPT-6 Astra 和 OpenAI 前沿模型的访问,帮助工程团队排查 bug、设计系统并加快交付速度。此举使更多工程团队得以借助这些模型提升开发效率。
Anthropic 称 Opus 5.5 相比 Opus 5 在默认设置下可为典型工作负载节省约 40% 成本,因 token 单价下降且完成任务耗用更少 token;该模型在网络安全和生物等高风险领域能力较强,触发保护机制的请求会被透明地路由到较旧模型。
AWS 宣布 Claude Opus 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上可用,是 Claude 5.5 系列首个模型。
推荐理由:原文给出 Claude Opus 5.5 相比 Opus 5 的成本、沟通和安全性变化,以及在 Amazon Bedrock 上从控制台到多种 API 的具体接入方法。
Latent Space 发布 2026 年 9 月 19 至 21 日 AINews 周报,头条是 Xiaomi MiMo-V2.6 系列:MiMo-V2.6-Pro 以 1.02T 总参数。
推荐理由:本期以小米 MiMo-V2.6-Pro 登顶开源权重为线索,串联 RL 环境开源、推理优化与 Agent 安全等一周动态。
Simon Willison 发布 llm-keys-ui 0.1 插件,解决在 Codex Remote 远程控制机器时需要配置 API key 的问题。
Steve Yegge 关闭了 Gas Town,承认尽管每月花费数千美元订阅编程 Agent,却只用它开发了 Gas Town。Databricks 向约 3,500 名工程师推出 GPT-6 Astra,其在复杂长程任务上明确优于 Opus 5 / Sol 5.6,但编码总支出增加约 60%。OpenAI 发布模型不对齐事件披露框架及六份案例报告。
GitHub 用 AI 智能体将 Copilot 智能体运行时完整重写为超过 800,000 行生产 Rust,通过 128 个 pull request 增量合入 main 并逐步发布,于 2026 年 8 月 21 日达成 100% Rust。
推荐理由:作者亲历复盘用 AI 智能体将 Copilot 运行时从 TypeScript 迁移到 80 万行 Rust 的过程,给出可迁移的增量迁移、提示词缓存与多会话协作方法。
OpenAI 介绍 ChatGPT Work 与 Codex analytics 两项分析能力,帮助团队了解 AI 使用与支出情况、发现培训需求,并将 AI 采用与业务成果关联起来。
Latent.Space 日报头条报道 TypeSafe 的 Jev 发布:一个用 RLCD 训练、只做决策分类路由打分而不生成文本的模型,宣称比小型前沿 LLM 快 20-200 倍、便宜 40-400 倍且输出 token 免费,社区认为适合替代生产系统中的结构化分类器、裁判和路由策略,但也提醒它需预定义输出格式、不能生成自由文本。
Perplexity 将 GPT-6 Astra 用于端到端系统,包括撰写沟通内容、修改软件以及监控生产系统。与使用早期模型相比,Perplexity 现在对这些系统的检查频率明显降低。
Cognition 在 Devin 中引入 GPT-6 Astra,用于改进 Devin 测试软件并验证其可用性的能力。目标是让工程师减少代码审查工作量、交付更多成果。
GitHub Copilot app 新增内置 diff、terminal 和 browser 面板,让用户无需在编辑器、终端和浏览器之间切换即可审查、运行并预览智能体改动。
OpenAI 推出 Agents API,一项由 Codex harness 驱动的托管服务,用于构建和启动云端智能体。该服务提供编排、长时间运行会话和工具使用能力。
一位 MIT 研究者使用 GPT-5.6 Sol 搭配 Codex,自主运行量子计算实验。它能分析实验结果并校准 qubit,展示了 AI 智能体在科研自动化中的应用。
1Password 工程师使用 Codex 快速构建新功能和内部工具,工程效率提升 21%,同时在严格安全策略下达到生产可用。
在 OpenAI 内部,coding agent 正在重塑 AI 研究方式。文章探讨了智能体使用情况、实验速度、任务复杂度及研究加速等方面的早期数据。
GitHub 推出 Project HydraFusion 研究预览,通过运行时多模型编排为每个任务生成执行计划,在 Single、Cascade、Critique 三种模式间选择以平衡质量、成本和延迟。
推荐理由:官方公布了 HydraFusion 的三种执行模式和三份基准的质量与成本数据,读者可以据此评估多模型编排对编码工作流的实际价值。