GPT 6.1 Sol:以五分之一的价格获得接近 Astra 的智能
OpenAI 推出 GPT 6.1 Sol,智能接近 Astra,价格仅为五分之一。该消息由 Simon Willison 于 9 月 29 日发布。
OpenAI 推出 GPT 6.1 Sol,智能接近 Astra,价格仅为五分之一。该消息由 Simon Willison 于 9 月 29 日发布。
Anthropic Frontier Red Team 在内部 Binary Exploitation benchmark 的 100 个任务上评测发现,GLM-5.3 在 4% 的试验中实现完整控制流劫持,Claude Mythos Preview 为 6%,而 Claude Opus 4.6 和 GLM-5.2 均无一成功。
OpenAI 的 GPT-6.1 Sol 在 Amazon Bedrock 正式可用,是 GPT-6 Sol 的重大升级。
推荐理由:官方发布说明了模型在代理编码等任务上的成本与性能对比,以及 Bedrock 上的安全与数据保留配置,便于评估落地。
OpenAI 发布 GPT-6.1 Sol,定位为接近 Astra 智能水平的模型,覆盖编码、计算机使用和专业工作场景,API 输入和输出 token 价格为 Astra 标准价的五分之一。
推荐理由:官方明确了 GPT-6.1 Sol 的定位与价格对比,读者可以直接评估在编码和计算机使用场景下的成本替代空间。
OpenAI 发布新模型 GPT-6.1 Sol,缓存输入定价每百万 token 0.10 美元,比上一代 GPT-6 Sol 低 50%、比标准输入低 95%,并宣称智能接近 Astra、整体成本降至前代五分之一(均无独立评测验证)。
OpenAI 发布 GPT-6.1 Sol,称其在 agentic 编码、计算机使用和办公任务上接近 GPT-6.1 Astra,成本约为五分之一,API 定价为每百万输入 token $2、输出 $10、缓存输入 $0.10。
推荐理由:原文汇总了 Sol 的定价、基准成绩与 Astra 因安全问题推迟的背景,读者可据此权衡性价比与安全取舍。
OpenAI 在 DevDay 上发布 GPT-6.1 Sol,称其在 agentic 编程、电脑操作和专业工作上接近 GPT-6 Astra,标准输入输出 token 价格为其五分之一。
推荐理由:原文给出 GPT-6.1 Sol 与 GPT-6 Astra 的价格和性能对比,并说明 GPT-6.1 Astra 因安全原因取消,读者可据此评估选用。
ElevenLabs 发布新语音模型 Eleven v4,对音频标签的遵循更准确,单次支持最多 10,000 字符约十分钟音频,语言支持从约 70 种增至 90 种以上,发音基准得分从 v3 的 85.6% 升至 91.7%。
NVIDIA 发布开源表格基础模型 Kumo Tabular,对分类和回归任务无需训练、调参或特征工程,单次前向传播即可预测新行标签,权重已在 Hugging Face 开放,采用 OpenMDW-1.1 许可证。
Anthropic 发布中档模型 Sonnet 5.5,称其比前代 Sonnet 5 快 30%,token 消耗显著更低。官方基准显示其在智能体编码上优于 Opus 5.5,网络攻防能力与 Opus 5 相当,因此成为首个适用 Fable 和 Opus 同等网络安全防护的 Sonnet 模型;新版 Haiku 预计未来几周内发布。
Anthropic 发布 Claude Sonnet 5.5,官方称运行快 30% 以上、多数工作成本最多低 30%,定价与 Sonnet 5 相同且各项基准全面超越。作者实测发现其编码能力接近 Opus 5.5,且它现已成为 claude.ai 免费档所用模型,而 ChatGPT 免费档用的是 Luna 5.6。此外公告重申 Haiku 5.5 将在未来几周内可用。
AWS 宣布 Claude Sonnet 5.5 可在 Amazon Bedrock 和 Claude Platform on AWS 使用,主打专注编码与知识工作,多数任务单次成本更低、速度更快。
推荐理由:原文给出 Sonnet 5.5 在 Bedrock 的能力变化、与 Opus 5.5 的分工建议和接入步骤,可据此规划工程工作流。
Anthropic 发布 Claude 5.5 系列第二款模型 Claude Sonnet 5.5,输出速度提升超过 30%,因每任务使用更少 token,实际成本最多下降 30%,多项基准接近 Opus 5.5。
推荐理由:汇总了 Sonnet 5.5 各基准分数、每任务成本变化和高风险网络安全防护细节,便于与 Opus 5.5 及 OpenAI 对位模型做成本比较。
H 公司发布 Holo4 系列通用计算机使用智能体模型,含 27B dense 与 35B-A3B MoE 两种规格,并附带更新版 Holotron4 Nano。
推荐理由:模型可跨 GUI、代码、MCP 和 API 多种接口工作并开源权重与轨迹,读者可对比其与前沿模型的成本差异来判断适用场景。
AINews 本期以 Claude Opus 5.5 发布为主题:该模型官方称多数任务达到 Fable 5.1 水平、比 Opus 5 便宜 40% 运行成本,成为 Claude Code 和 Claude 应用的新默认模型,Sonnet 5.5 与 Haiku 5.5 将在未来数周跟进。
推荐理由:这期汇编梳理了 Claude Opus 5.5 与 GPT-6 Sol/Luna 同日发布的价格与评测分歧,包括高 token 用量抵消降价的成本拆解,便于读者对比两家宣传口径。
Anthropic 称 Opus 5.5 相比 Opus 5 在默认设置下可为典型工作负载节省约 40% 成本,因 token 单价下降且完成任务耗用更少 token;该模型在网络安全和生物等高风险领域能力较强,触发保护机制的请求会被透明地路由到较旧模型。
OpenAI 发布 GPT-6 Sol 和 Luna 两个模型,将前沿智能带入日常工作,两者在能力与成本之间提供不同的平衡。
推荐理由:官方宣布 GPT-6 Sol 和 Luna 两个模型,定位在能力与成本间做不同取舍,可关注两者的差异化定位。
AWS 宣布 Claude Opus 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上可用,是 Claude 5.5 系列首个模型。
推荐理由:原文给出 Claude Opus 5.5 相比 Opus 5 的成本、沟通和安全性变化,以及在 Amazon Bedrock 上从控制台到多种 API 的具体接入方法。
OpenAI 的 GPT-6 Astra 帮助 Parallel 的智能体研究和整合劳动力市场数据,与此前模型相比用时和成本均减半。
Latent.Space 日报头条报道 TypeSafe 的 Jev 发布:一个用 RLCD 训练、只做决策分类路由打分而不生成文本的模型,宣称比小型前沿 LLM 快 20-200 倍、便宜 40-400 倍且输出 token 免费,社区认为适合替代生产系统中的结构化分类器、裁判和路由策略,但也提醒它需预定义输出格式、不能生成自由文本。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款语音对话模型,主打近实时推理与语音智能体。
推荐理由:官方给出两款语音对话模型的评测成绩、语言与工具调用能力和开放入口,读者可据此评估其用于语音智能体开发的适配度。
Perplexity 将 GPT-6 Astra 用于端到端系统,包括撰写沟通内容、修改软件以及监控生产系统。与使用早期模型相比,Perplexity 现在对这些系统的检查频率明显降低。
OpenAI 发布 GPT-6 Astra,称其为企业业务场景最强模型。模型具备高级推理、计算机使用能力,写作与设计判断力也更强。
Hugging Face 推出 NeoMME 多语言多模态编码器家族,含 260M 和 800M 两个规模,用单个双向 Transformer 从头处理文本 token 和原始图像 patch,无需单独的预训练视觉塔或因果语言模型。
Playco 使用 GPT-6 Astra 从一个灰盒基础构建了三个主题游戏原型,手动修复比使用上一代模型减少了 50%。
Google 发布时序基础模型 TimesFM-3,原生支持多变量零样本预测,参数量 330M,预训练语料包含超过 1 万亿时间点。模型采用 decoder-only Transformer 与交替注意力架构,通过 Contiguous Patch Masking 在单次前向传播中生成完整预测区间,并为每个目标输出 10% 到 90% 共 9 个分位数。
Microsoft Research 推出 GigaPath-Flash 和 GigaTIME-Flash 研究模型,以大幅提升病理学研究的计算效率。
IBM 发布 Granite 4.2 推理模型家族,包含 3B、8B、30B 三个 dense 尺寸,基于 Granite-4.1 基座(从头预训练约 15T tokens,五阶段策略将上下文窗口扩展至 512K tokens),经 CoT 与智能体轨迹数据的 SFT 后,再用异步 GRPO 多阶段 RL 流水线后训练。
推荐理由:官方完整披露 Granite 4.2 的五阶段预训练、SFT 配比与多阶段 RL 课程设计,读者可以直接对照复现其训练路线。
Microsoft Research 发布深度学习 DFT 泛函 Skala 1.1,训练数据较前一版增加 2.5 倍,在 GMTKN55 基准的 55 个类别中 32 个排名第一,加权平均误差 2.8 kcal/mol,超过最昂贵的 global hybrid 泛函,同时保持 meta-GGA 级计算成本。
Google DeepMind 发布 Gemini 3.7 Flash,称其为迄今最智能的编码与 Agent 主力模型,距 Gemini 3.6 Flash 仅三周。
推荐理由:官方公布性能数据与新定价,开发者可对照基准数字和价格判断是否迁移现有工作流。
Google DeepMind 发布多语言手语转文本(SL2T)模型,为 Gboard 和 Live Transcribe 带来手语转文字输入,率先支持 Pixel 11 上的 ASL 转英语。
推荐理由:官方说明模型训练规模、基准成绩和隐私设计,读者可了解手语翻译落地的技术路径与现存限制。
微软研究院发布研究模型 CARE-X,一个统一的胸部 X 光 VLM,结合生成式与判别式双推理,支持报告生成、疾病定位、多标签分类等多样临床解读任务。该模型采用 DAPO 强化学习在多任务设置中奖励临床正确性,并在 Narayana Health 的真实印度临床数据上验证。另一项独立实验将 Qwen3-VL-4B-Instruct 与确定性测量工具配对,评估直接计算能否提升测量依赖病灶的表现。
Meta 于今日发布 Muse Glimmer,一个从 Muse 蒸馏而来的 30B 多模态开源模型,采用 Apache 2.0 许可,面向本地隐私敏感的 Agentic 场景如编码、文档分析和个人助手。
推荐理由:官方介绍可帮助读者了解这个 30B 本地多模态模型在 Agentic 基准上的表现与本地部署路径。
Mistral 发布 3B 开源权重多模态安全分类器 Shieldstral,将内容审核建模为策略自适应的问答任务,在推理时接受自然语言策略并输出校准的安全分数。该模型在文本安全上匹敌最大 7 倍于其体量的开放护栏模型,在多模态审核上创造新 SOTA,以 Apache 2.0 协议开放权重,可在单张 16GB GPU 上运行。
推荐理由:原文给出把内容审核改写成策略自适应问答的建模思路和数据构建方法,对做安全分类器的团队有可迁移的参考价值。
Google DeepMind 发布 Gemini Robotics 2 系列机器人模型,包含 VLA 模型 Gemini Robotics 2、具身推理模型 Gemini Robotics ER 2 和端侧模型 Gemini Robotics On-Device 2。
推荐理由:官方一次性放出 VLA、具身推理和端侧三个机器人模型,读者可以借此了解全身控制、灵巧操作与多机协作的具体进展。
Google DeepMind 发布三款新 Gemini 模型:3.6 Flash 在 Artificial Analysis Index 上比 3.5 Flash 少输出 17% token。
推荐理由:官方给出三个新 Flash 模型的效率数据和定价,并披露 Gemini 4 预训练已启动,读者可据此评估升级选择。
Google DeepMind 发布基于 3.5 Flash 微调的轻量网络安全模型 Gemini 3.5 Flash Cyber,用于发现、验证和修补漏洞。
Mistral AI 发布首个具身导航模型 Robostral Navigate,8B 参数,仅用单个 RGB 相机即可按自然语言指令自主导航。
AI 系统 Fable 在 KernelBench-Mega 上写出首个真实且最快的 megakernel,在 RTX PRO 6000 Blackwell 上实现 18.71X 加速,超过 Claude Opus 4.8(14.4X)、GLM-5.2(11.14X)和 GPT 5.5(4.34X)。
Mistral 发布 Apache-2.0 开源的 Leanstral 1.5,总参数 119B、激活 6B,专攻 Lean 4 形式化证明。模型饱和 miniF2F,解出 PutnamBench 587/672 题,在 FATE-H 87%、FATE-X 34% 达到新 SOTA,成本约每题 $4。
推荐理由:官方给出了完整训练流程、基准数字和开源获取方式,读者可以据此评估它在 Lean 4 形式化证明上的实际可用性。