跳到正文

#编码

今日 7 条
今天9月30日周三
  1. AWS Machine Learning Blog62

    GPT-6.1 Sol 正式登陆 Amazon Bedrock

    OpenAI 的 GPT-6.1 Sol 在 Amazon Bedrock 正式可用,是 GPT-6 Sol 的重大升级。

    推荐理由:官方发布说明了模型在代理编码等任务上的成本与性能对比,以及 Bedrock 上的安全与数据保留配置,便于评估落地。

  2. The Decoder76

    OpenAI 发布 GPT-6.1 Sol,以五分之一成本接近 Astra

    OpenAI 发布 GPT-6.1 Sol,称其在 agentic 编码、计算机使用和办公任务上接近 GPT-6.1 Astra,成本约为五分之一,API 定价为每百万输入 token $2、输出 $10、缓存输入 $0.10。

    推荐理由:原文汇总了 Sol 的定价、基准成绩与 Astra 因安全问题推迟的背景,读者可据此权衡性价比与安全取舍。

9月29日周二
  1. Simon Willison71

    Anthropic 发布 Claude Sonnet 5.5,提速 30% 以上并成为 claude.ai 免费档模型

    Anthropic 发布 Claude Sonnet 5.5,官方称运行快 30% 以上、多数工作成本最多低 30%,定价与 Sonnet 5 相同且各项基准全面超越。作者实测发现其编码能力接近 Opus 5.5,且它现已成为 claude.ai 免费档所用模型,而 ChatGPT 免费档用的是 Luna 5.6。此外公告重申 Haiku 5.5 将在未来几周内可用。

  2. The Decoder76

    Anthropic 发布 Claude Sonnet 5.5,基准接近 Opus 5.5 且每任务成本最多低 30%

    Anthropic 发布 Claude 5.5 系列第二款模型 Claude Sonnet 5.5,输出速度提升超过 30%,因每任务使用更少 token,实际成本最多下降 30%,多项基准接近 Opus 5.5。

    推荐理由:汇总了 Sonnet 5.5 各基准分数、每任务成本变化和高风险网络安全防护细节,便于与 Opus 5.5 及 OpenAI 对位模型做成本比较。

9月28日周一
9月27日周日
9月26日周六
9月25日周五
  1. GitHub Blog · AI & ML53

    GitHub Copilot 如何用 canvas 替代聊天界面

    GitHub Copilot 团队认为聊天不是与 AI 交互的正确界面,介绍了 GitHub Copilot app 中的 canvas 功能,它是可与应用内 agent 双向通信的全栈小程序。作者用 Connect 4 游戏、Winget 包管理、SQLite 操作和自动化开发工作流等示例说明,与其让 agent 处理每次交互浪费 token,不如让它构建一个后续交互免费的自定义工具。

  2. GitHub Blog · AI & ML64

    GitHub Security Lab 发布 Fuzzing Taskflow,用 LLM Agent 自动化 C/C++ 项目模糊测试

    GitHub Security Lab 的 Antonio Morales 发布 Fuzzing Taskflow,一个基于 Taskflow Agent 的自主模糊测试流水线,只需提供 GitHub 仓库即可自动识别入口点、编写 harness、运行 AFL++、改进覆盖并分诊崩溃。

    推荐理由:原文详述了用 LLM Agent 自动写 harness、跑 AFL、追覆盖缺口和分诊崩溃的完整流水线设计,可直接复用。

9月24日周四
9月23日周三
  1. Latent Space83

    Latent Space AINews:Claude Opus 5.5 发布成新默认模型,OpenAI 随即降价 40-50% 推出 GPT-6 Sol 和 Luna

    AINews 本期以 Claude Opus 5.5 发布为主题:该模型官方称多数任务达到 Fable 5.1 水平、比 Opus 5 便宜 40% 运行成本,成为 Claude Code 和 Claude 应用的新默认模型,Sonnet 5.5 与 Haiku 5.5 将在未来数周跟进。

    推荐理由:这期汇编梳理了 Claude Opus 5.5 与 GPT-6 Sol/Luna 同日发布的价格与评测分歧,包括高 token 用量抵消降价的成本拆解,便于读者对比两家宣传口径。

  2. Simon Willison14

    Simon Willison 将于 10 月 14 日在旧金山主持 Agentic Engineering 聚谈会

    Simon Willison 将与 Jesse Vincent 于 10 月 14 日(周三)在旧金山共同举办一场关于 Agentic Engineering 的晚间 Birds of a Feather 聚谈会,面向用 coding agents 构建有趣项目的人。活动采取非正式 show-and-tell 形式,鼓励但不强制分享,尤其欢迎未公开讨论过的实验和未完成项目,明确排除产品推销。

9月22日周二
9月21日周一
9月17日周四
  1. Latent Space40

    AI 新闻现实检验:Steve Yegge 关闭 Gas Town,Databricks 使用 Astra 成本增加 60%

    Steve Yegge 关闭了 Gas Town,承认尽管每月花费数千美元订阅编程 Agent,却只用它开发了 Gas Town。Databricks 向约 3,500 名工程师推出 GPT-6 Astra,其在复杂长程任务上明确优于 Opus 5 / Sol 5.6,但编码总支出增加约 60%。OpenAI 发布模型不对齐事件披露框架及六份案例报告。

  2. GitHub Blog · AI & ML80

    GitHub 用 Copilot 将 Copilot 智能体运行时从 TypeScript 增量迁移至 Rust

    GitHub 用 AI 智能体将 Copilot 智能体运行时完整重写为超过 800,000 行生产 Rust,通过 128 个 pull request 增量合入 main 并逐步发布,于 2026 年 8 月 21 日达成 100% Rust。

    推荐理由:作者亲历复盘用 AI 智能体将 Copilot 运行时从 TypeScript 迁移到 80 万行 Rust 的过程,给出可迁移的增量迁移、提示词缓存与多会话协作方法。

9月16日周三
  1. Latent Space64

    TypeSafe 发布决策模型 Jev,宣称比小型前沿 LLM 快 100 倍、成本低 200 倍

    Latent.Space 日报头条报道 TypeSafe 的 Jev 发布:一个用 RLCD 训练、只做决策分类路由打分而不生成文本的模型,宣称比小型前沿 LLM 快 20-200 倍、便宜 40-400 倍且输出 token 免费,社区认为适合替代生产系统中的结构化分类器、裁判和路由策略,但也提醒它需预定义输出格式、不能生成自由文本。

9月14日周一
9月12日周六
9月11日周五
9月10日周四
9月9日周三
9月8日周二
9月6日周日
9月5日周六
  1. GitHub Blog · AI & ML68

    GitHub 发布 Project HydraFusion 研究预览,用多模型运行时编排提供前沿级编码质量

    GitHub 推出 Project HydraFusion 研究预览,通过运行时多模型编排为每个任务生成执行计划,在 Single、Cascade、Critique 三种模式间选择以平衡质量、成本和延迟。

    推荐理由:官方公布了 HydraFusion 的三种执行模式和三份基准的质量与成本数据,读者可以据此评估多模型编排对编码工作流的实际价值。