GPT-6.1 Sol 正式登陆 Amazon Bedrock
OpenAI 的 GPT-6.1 Sol 在 Amazon Bedrock 正式可用,是 GPT-6 Sol 的重大升级。
推荐理由:官方发布说明了模型在代理编码等任务上的成本与性能对比,以及 Bedrock 上的安全与数据保留配置,便于评估落地。
OpenAI 的 GPT-6.1 Sol 在 Amazon Bedrock 正式可用,是 GPT-6 Sol 的重大升级。
推荐理由:官方发布说明了模型在代理编码等任务上的成本与性能对比,以及 Bedrock 上的安全与数据保留配置,便于评估落地。
xAI 的 Grok 4.7 上线 Amazon Bedrock,提供 500K token 上下文窗口和 low 到 xhigh 四档推理力度,通过 us.xai.grok-4.7 和 global.xai.grok-4.7 跨区域推理配置接入,支持 Responses、Chat Completions 和 Converse API。
推荐理由:原文给出 Bedrock 上的接入方式、推理档位与 Artificial Analysis 独立评测数据,可帮助读者评估成本与接入取舍。
本文演示在 Amazon SageMaker HyperPod 上用开源 RL 框架 SkyRL 训练 Qwen3-VL-8B 视觉语言模型完成视觉迷宫导航任务。
Liquid AI 为视觉语言模型 LFM2.5-VL-3B 发布实验性 DSpark 草稿模型,通过投机解码在不改变输出质量的前提下加速推理。解码最高提速 3.13x(M5 Max 端侧)和 2.66x(H100),端到端最高提升 2.62x 和 2.27x;草稿模型增加 280M 参数(约 8.9%),首日支持 llama.cpp、MLX-VLM 和 SGLang。
推荐理由:原文给出视觉语言模型投机解码加速的具体数字、内存开销和第一天框架支持,读者可以据此评估端侧与 GPU 部署收益。
AWS 宣布 Claude Opus 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上可用,是 Claude 5.5 系列首个模型。
推荐理由:原文给出 Claude Opus 5.5 相比 Opus 5 的成本、沟通和安全性变化,以及在 Amazon Bedrock 上从控制台到多种 API 的具体接入方法。
OpenAI 正与一个独立的“数学与人工智能咨询小组”(Advisory Group on Mathematics and Artificial Intelligence)合作,为新兴 AI 研究结果的审查与对外沟通提供指导。该小组独立运作,帮助 OpenAI 评估和传达相关领域的新进展。
NVIDIA Vera Rubin NVL72 首次提交 MLPerf Inference v6.1 预览成绩,在 Qwen3-VL 上吞吐最高达 GB300 NVL72 的 3.7x,在 DeepSeek-R1 上达 2.5x,使用 vLLM、Dynamo 和 TensorRT-LLM。
Salesforce 在 Dreamforce 上宣布其首个 CRM 推理模型 Koa,通过对 NVIDIA Nemotron 3 Super 进行后训练打造,因 NVIDIA Nemotron 开源,Salesforce 可在自己的基础设施内微调并运行模型,训练与推理均不使用任何客户数据。
Google Research 在 ICML 2026 论文中提出 Retrieve-for-Train 框架,通过离线 RL 将奖励对齐的查询 fan-out 编译为监督信号,蒸馏进 53.9M 参数的扩散检索器,实现单次非自回归查询扩展,免去测试时的 CoT 思考 token 开销。
NVIDIA 在 AI Infra Summit 上发布 Vera Rubin 与 DSX 平台的多项进展,主题是以每兆瓦 token 产出衡量 AI 工厂能效。
推荐理由:NVIDIA 官方汇总 Vera Rubin 与 DSX 平台在每兆瓦 token 产出上的多项合作实测数据,可帮助读者评估 AI 工厂能效方向。
OpenAI 发布 GPT-6 Astra,称其为企业业务场景最强模型。模型具备高级推理、计算机使用能力,写作与设计判断力也更强。
OpenAI 宣布分享一个针对 Navier–Stokes 千禧年大奖难题的 AI 生成解答,附带论文写作与 Lean 形式化证明。
推荐理由:官方同时给出论文与 Lean 形式化证明,读者可以借此了解 AI 在数学前沿问题上的实际产出形式。
IBM 发布 Granite 4.2 推理模型家族,包含 3B、8B、30B 三个 dense 尺寸,基于 Granite-4.1 基座(从头预训练约 15T tokens,五阶段策略将上下文窗口扩展至 512K tokens),经 CoT 与智能体轨迹数据的 SFT 后,再用异步 GRPO 多阶段 RL 流水线后训练。
推荐理由:官方完整披露 Granite 4.2 的五阶段预训练、SFT 配比与多阶段 RL 课程设计,读者可以直接对照复现其训练路线。
Liquid AI 为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 三个模型发布 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下提升解码速度。
推荐理由:原文给出三类模型的加速数字、质量不变的原理和 llama.cpp、SGLang 的接入命令,读者可据此评估端侧与 GPU 推理收益。
Dharma AI 在 Hugging Face Blog 发布约束感知 GPU 分配器,与 FIFO 调度器在 7 个基准场景对比,GPU 利用率最高提升 33 个百分点,优先级加权产出平均提升 52%。该调度器将实时推理视为需求曲线而非峰值预留,批任务按优先级在 24 小时视野内规划,每次决策仅 1 至 15 毫秒,每个时间步只提交当前分配并每 30 至 60 分钟重跑以吸收预测误差。
Google Research 发布 knowledge profiling 行为框架和 WikiProfile 基准(2,150 条 Wikipedia 事实,每条配 10 个任务),评估 13 个 LLM。
推荐理由:原文用知识画像方法区分编码与召回失败,给出 frontier 模型事实错误主因是召回的关键数据。
Mistral 宣布三项主权 AI 举措:Mistral Regional Endpoints 正式可用,可选择推理在 Europe 或 US 运行;Mistral Priority Tier 公开预览,提供自定义速率限制和 uptime SLA。
Meta 于今日发布 Muse Glimmer,一个从 Muse 蒸馏而来的 30B 多模态开源模型,采用 Apache 2.0 许可,面向本地隐私敏感的 Agentic 场景如编码、文档分析和个人助手。
推荐理由:官方介绍可帮助读者了解这个 30B 本地多模态模型在 Agentic 基准上的表现与本地部署路径。
Google Research 发布 Chain-of-Evidence 可验证性框架及其实例 Science One Framework,配套 CoE Audit 自动审计指标。
Microsoft Research 推出 EvoLib,一个让大语言模型在推理时从自身经验自监督学习、无需更新模型的框架。它把成功方案提炼为可复用技能、把错误提炼为反思性洞见,并通过整合与动态加权机制持续演化知识。
Berkeley AI Research 提出 ABBEL 框架,将大语言模型在长程交互中的摘要形式化为自然语言信念状态,并通过信念评分监督其信息内容。在 CollabBench 协作编程环境中,基于重构的信念评分使 ABBEL-rec-BG 将与全上下文模型的性能差距缩小约 50%,训练步数从 100 减至 50,且峰值上下文 token 长度仍显著低于全上下文设置。
Google Research 发布 SymptomAI 研究,13,917 名参与者与五个 Gemini Flash 2.0 症状评估智能体对话进行鉴别诊断。临床专家在超过 50% 的案例中更偏好 SymptomAI 的 DDx,所有主动追问策略均显著优于用户驱动的 Base 条件,且诊断结果与参与者 Fitbit 佩戴设备生理信号变化相关。研究强调所有诊断仅供研究分析,不构成临床诊断。
推荐理由:原文给出真实人群随机研究和临床对照结果,读者可了解对话式症状评估在非理想化场景下的实际表现。
Google DeepMind 发布三款新 Gemini 模型:3.6 Flash 在 Artificial Analysis Index 上比 3.5 Flash 少输出 17% token。
推荐理由:官方给出三个新 Flash 模型的效率数据和定价,并披露 Gemini 4 预训练已启动,读者可据此评估升级选择。
Hugging Face 博客发布 Profiling in PyTorch 系列第三篇,用 profiler 分析注意力机制从朴素实现到 SDPA 各后端的表现。
推荐理由:文章用 profiler 逐一对注意力各实现读 trace,给出 kernel 数、耗时与占用率等一手数据,方法可直接迁移到自己的模型调优。
Mistral 发布 Apache-2.0 开源的 Leanstral 1.5,总参数 119B、激活 6B,专攻 Lean 4 形式化证明。模型饱和 miniF2F,解出 PutnamBench 587/672 题,在 FATE-H 87%、FATE-X 34% 达到新 SOTA,成本约每题 $4。
推荐理由:官方给出了完整训练流程、基准数字和开源获取方式,读者可以据此评估它在 Lean 4 形式化证明上的实际可用性。
Dharma AI 解读 Goldfeder、Wyder、LeCun 与 Shwartz-Ziv 2026 年论文《AI Must Embrace Specialization via Superhuman Adaptable Intelligence》,论证专业化是有效 AI 系统的必然路径。
Google 通过为冻结权重的 Gemini Nano v3 模型附加轻量 MTP head,实现端侧推理提速,已部署到 Pixel 9 和 10 系列。该 zero-copy 架构直接复用主模型的 KV cache,每个实例节省 130MB 内存,且因错误草稿会在验证中被丢弃,输出与主模型逐位一致。
Google Research 将在 COLM 2026 发表的论文发现,开启链式推理可让 Gemini-2.5(Flash 和 Pro)与 Qwen3-32B 召回推理关闭时几乎无法给出的单跳事实答案。
推荐理由:论文给出两类机制实验和幻觉审计结果,读者可以据此理解推理为何能帮助单跳事实召回以及其局限。
Google DeepMind 发布开源实验模型 DiffusionGemma,采用 26B 总参数、3.8B 激活的 MoE 扩散架构,在专用 GPU 上文本生成最高提速 4 倍,单块 NVIDIA H100 超过 1000 tokens/s,RTX 5090 超过 700 tokens/s。
推荐理由:官方给出扩散文本生成的速度数据、显存占用与质量取舍,适合评估本地交互场景的落地条件。
Google DeepMind 公布在塞拉利昂开展的预注册对照试验结果,使用 Guided Learning 的学生数学成绩较对照组提升 0.258 个标准差,约相当于 1.2 至 1.7 年的常规学习进度。
推荐理由:原文给出预注册RCT的关键数据和开放式材料,读者可以了解AI辅助教学在真实课堂中的效果与局限。
Google 在 I/O 2026 上宣布推出 Gemini for Science,一套整合其基础研究成果的实验性科学工具套件。
剑桥大学 Clare Bryant 教授使用 Google DeepMind 的 Co-Scientist 研究病原体跨物种传播引发脓毒症等重症的分子开关。该工具根据其流感研究提案生成并排序假设,逐步将候选蛋白细化到具体氨基酸。原本需两到三年的实验验证工作有望在六个月内完成。
爱丁堡大学Filippo Menolascina团队使用Co-Scientist研究代谢功能障碍相关脂肪性肝炎(MASH),筛选潜在联合用药方案。系统针对药物resmetirom仅对部分患者有效的问题,提出NLRP3炎症小体是连接炎症与代谢的分子桥梁,该假说已获实验验证,有望推动双重靶向疗法。
Google DeepMind 的 Co-Scientist 正在连接 MIT 的 Ritu Raman 与 Boston Children's Hospital 的 Ryan Flynn 两个实验室,共同研究 ALS。
Google DeepMind 介绍斯坦福医学院 Gary Peltz 团队发表于 Advanced Science 的研究,用 Co-Scientist 从既有药物文献中筛选可重定位治疗肝纤维化的候选药。
Google DeepMind 发布 Gemini 3.5 模型系列,首发 Gemini 3.5 Flash,主打智能体与编码性能,3.5 Pro 将于下月推出。
推荐理由:官方发布给出了 3.5 Flash 在编码与智能体基准上的具体成绩、速度对比和开放渠道,读者可据此评估替换现有工作流模型的收益。
Berkeley AI Research 发文分析并行推理研究进展,核心问题是让推理模型自主决定何时分解并并行独立子任务、生成多少并发线程以及如何协调。文章梳理了从 Self-consistency、Best-of-N 到 Tree of Thoughts、MCTS 的固定并行方法,以及 ParaThinker、GroupThink、Hogwild!
Google Research 在 ICLR 论文中提出 ReasoningBank,一个从成功与失败经验中提炼结构化推理记忆的智能体记忆框架,并配套 MaTTS 记忆感知测试时扩展方法。
Berkeley AI Research 等团队提出 GRASP,一种基于梯度的世界模型规划器,让长时程规划更实用。方法包括将轨迹提升到虚拟状态以实现跨时间并行的优化、在状态迭代中直接加入随机性以促进探索,并对梯度进行重塑以避开高维视觉模型中脆弱的 state-input 梯度。
Google DeepMind 发布 Gemma 4 开源模型,称其为迄今最智能的开放模型,采用 Apache 2.0 许可,提供 E2B、E4B、26B MoE 和 31B Dense 四种尺寸。
推荐理由:官方发布给出四个尺寸、榜单名次、上下文长度与部署路径等具体信息,读者可据此评估选型和端侧部署方案。