GPT-6.1 Sol 正式登陆 Amazon Bedrock
OpenAI 的 GPT-6.1 Sol 在 Amazon Bedrock 正式可用,是 GPT-6 Sol 的重大升级。
推荐理由:官方发布说明了模型在代理编码等任务上的成本与性能对比,以及 Bedrock 上的安全与数据保留配置,便于评估落地。
模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。
OpenAI 的 GPT-6.1 Sol 在 Amazon Bedrock 正式可用,是 GPT-6 Sol 的重大升级。
推荐理由:官方发布说明了模型在代理编码等任务上的成本与性能对比,以及 Bedrock 上的安全与数据保留配置,便于评估落地。
OpenAI 在 DevDay 上发布 GPT-6.1 Sol,称其在 agentic 编程、电脑操作和专业工作上接近 GPT-6 Astra,标准输入输出 token 价格为其五分之一。
推荐理由:原文给出 GPT-6.1 Sol 与 GPT-6 Astra 的价格和性能对比,并说明 GPT-6.1 Astra 因安全原因取消,读者可据此评估选用。
xAI 的 Grok 4.7 上线 Amazon Bedrock,提供 500K token 上下文窗口和 low 到 xhigh 四档推理力度,通过 us.xai.grok-4.7 和 global.xai.grok-4.7 跨区域推理配置接入,支持 Responses、Chat Completions 和 Converse API。
推荐理由:原文给出 Bedrock 上的接入方式、推理档位与 Artificial Analysis 独立评测数据,可帮助读者评估成本与接入取舍。
Anthropic 发布 Claude 5.5 系列第二款模型 Claude Sonnet 5.5,输出速度提升超过 30%,因每任务使用更少 token,实际成本最多下降 30%,多项基准接近 Opus 5.5。
推荐理由:汇总了 Sonnet 5.5 各基准分数、每任务成本变化和高风险网络安全防护细节,便于与 Opus 5.5 及 OpenAI 对位模型做成本比较。
Liquid AI 为视觉语言模型 LFM2.5-VL-3B 发布实验性 DSpark 草稿模型,通过投机解码在不改变输出质量的前提下加速推理。解码最高提速 3.13x(M5 Max 端侧)和 2.66x(H100),端到端最高提升 2.62x 和 2.27x;草稿模型增加 280M 参数(约 8.9%),首日支持 llama.cpp、MLX-VLM 和 SGLang。
推荐理由:原文给出视觉语言模型投机解码加速的具体数字、内存开销和第一天框架支持,读者可以据此评估端侧与 GPU 部署收益。
AWS 宣布 Claude Opus 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上可用,是 Claude 5.5 系列首个模型。
推荐理由:原文给出 Claude Opus 5.5 相比 Opus 5 的成本、沟通和安全性变化,以及在 Amazon Bedrock 上从控制台到多种 API 的具体接入方法。
Latent Space 发布 2026 年 9 月 19 至 21 日 AINews 周报,头条是 Xiaomi MiMo-V2.6 系列:MiMo-V2.6-Pro 以 1.02T 总参数。
推荐理由:本期以小米 MiMo-V2.6-Pro 登顶开源权重为线索,串联 RL 环境开源、推理优化与 Agent 安全等一周动态。
NVIDIA 在 AI Infra Summit 上发布 Vera Rubin 与 DSX 平台的多项进展,主题是以每兆瓦 token 产出衡量 AI 工厂能效。
推荐理由:NVIDIA 官方汇总 Vera Rubin 与 DSX 平台在每兆瓦 token 产出上的多项合作实测数据,可帮助读者评估 AI 工厂能效方向。
OpenAI 宣布分享一个针对 Navier–Stokes 千禧年大奖难题的 AI 生成解答,附带论文写作与 Lean 形式化证明。
推荐理由:官方同时给出论文与 Lean 形式化证明,读者可以借此了解 AI 在数学前沿问题上的实际产出形式。
IBM 发布 Granite 4.2 推理模型家族,包含 3B、8B、30B 三个 dense 尺寸,基于 Granite-4.1 基座(从头预训练约 15T tokens,五阶段策略将上下文窗口扩展至 512K tokens),经 CoT 与智能体轨迹数据的 SFT 后,再用异步 GRPO 多阶段 RL 流水线后训练。
推荐理由:官方完整披露 Granite 4.2 的五阶段预训练、SFT 配比与多阶段 RL 课程设计,读者可以直接对照复现其训练路线。
Liquid AI 为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 三个模型发布 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下提升解码速度。
推荐理由:原文给出三类模型的加速数字、质量不变的原理和 llama.cpp、SGLang 的接入命令,读者可据此评估端侧与 GPU 推理收益。
Google Research 发布 knowledge profiling 行为框架和 WikiProfile 基准(2,150 条 Wikipedia 事实,每条配 10 个任务),评估 13 个 LLM。
推荐理由:原文用知识画像方法区分编码与召回失败,给出 frontier 模型事实错误主因是召回的关键数据。
Meta 于今日发布 Muse Glimmer,一个从 Muse 蒸馏而来的 30B 多模态开源模型,采用 Apache 2.0 许可,面向本地隐私敏感的 Agentic 场景如编码、文档分析和个人助手。
推荐理由:官方介绍可帮助读者了解这个 30B 本地多模态模型在 Agentic 基准上的表现与本地部署路径。
Google Research 发布 SymptomAI 研究,13,917 名参与者与五个 Gemini Flash 2.0 症状评估智能体对话进行鉴别诊断。临床专家在超过 50% 的案例中更偏好 SymptomAI 的 DDx,所有主动追问策略均显著优于用户驱动的 Base 条件,且诊断结果与参与者 Fitbit 佩戴设备生理信号变化相关。研究强调所有诊断仅供研究分析,不构成临床诊断。
推荐理由:原文给出真实人群随机研究和临床对照结果,读者可了解对话式症状评估在非理想化场景下的实际表现。
Google DeepMind 发布三款新 Gemini 模型:3.6 Flash 在 Artificial Analysis Index 上比 3.5 Flash 少输出 17% token。
推荐理由:官方给出三个新 Flash 模型的效率数据和定价,并披露 Gemini 4 预训练已启动,读者可据此评估升级选择。
Hugging Face 博客发布 Profiling in PyTorch 系列第三篇,用 profiler 分析注意力机制从朴素实现到 SDPA 各后端的表现。
推荐理由:文章用 profiler 逐一对注意力各实现读 trace,给出 kernel 数、耗时与占用率等一手数据,方法可直接迁移到自己的模型调优。
Mistral 发布 Apache-2.0 开源的 Leanstral 1.5,总参数 119B、激活 6B,专攻 Lean 4 形式化证明。模型饱和 miniF2F,解出 PutnamBench 587/672 题,在 FATE-H 87%、FATE-X 34% 达到新 SOTA,成本约每题 $4。
推荐理由:官方给出了完整训练流程、基准数字和开源获取方式,读者可以据此评估它在 Lean 4 形式化证明上的实际可用性。
Google Research 将在 COLM 2026 发表的论文发现,开启链式推理可让 Gemini-2.5(Flash 和 Pro)与 Qwen3-32B 召回推理关闭时几乎无法给出的单跳事实答案。
推荐理由:论文给出两类机制实验和幻觉审计结果,读者可以据此理解推理为何能帮助单跳事实召回以及其局限。
Google DeepMind 发布开源实验模型 DiffusionGemma,采用 26B 总参数、3.8B 激活的 MoE 扩散架构,在专用 GPU 上文本生成最高提速 4 倍,单块 NVIDIA H100 超过 1000 tokens/s,RTX 5090 超过 700 tokens/s。
推荐理由:官方给出扩散文本生成的速度数据、显存占用与质量取舍,适合评估本地交互场景的落地条件。
Google DeepMind 公布在塞拉利昂开展的预注册对照试验结果,使用 Guided Learning 的学生数学成绩较对照组提升 0.258 个标准差,约相当于 1.2 至 1.7 年的常规学习进度。
推荐理由:原文给出预注册RCT的关键数据和开放式材料,读者可以了解AI辅助教学在真实课堂中的效果与局限。