NVIDIA Isaac ROS 5.0 发布:推进智能体化开源机器人开发
NVIDIA 在多伦多 ROSCon 大会上发布 Isaac ROS 5.0,为约 130 万 ROS 用户带来智能体化工作流与平台支持。新版本支持 ROS Lyrical 和 Ubuntu 24.04,新增 FoundationStereo 微调技能与 Agent 就绪文档,FoundationPose 推理库使物体位姿追踪速度提升 5.5x。
NVIDIA 在多伦多 ROSCon 大会上发布 Isaac ROS 5.0,为约 130 万 ROS 用户带来智能体化工作流与平台支持。新版本支持 ROS Lyrical 和 Ubuntu 24.04,新增 FoundationStereo 微调技能与 Agent 就绪文档,FoundationPose 推理库使物体位姿追踪速度提升 5.5x。
Hugging Face 宣布 transformers 新增 GGUF 模型运行支持,通过 from_pretrained 传入 gguf_file 即可加载 Hub 上的量化 checkpoint,在 Apple Silicon 上本地生成。
推荐理由:官方给出了从加载、量化选择到与 llama.cpp 对比的完整路径,读者可以直接上手在 Mac 本地跑 GGUF。
Higgsfield AI 利用 GPT-6 Astra,在一天内推出了新的视频功能。这些功能让小型企业更轻松地制作视频广告,并加速新创意工具的上市速度。
OpenAI 为 OpenAI Academy 推出新的学习路径,面向员工、开发者、领导者、教育者和学生。这些学习路径帮助用户构建并展示实用的 AI 技能。
V7 采用 GPT-5.6,将成本降低 78%,同时提升准确率。它能将企业分散的文件转化为智能体可用的上下文,完成复杂的、带来源链接的工作。
Simon Willison 于 2026 年 9 月 20 日发布了 datasette-explain 0.2.2 版本。原文未提供该版本的具体更新内容。
本期要闻:Anthropic 在 Claude Code 推出 Projects,单个对话可并行开启多个云端线程、传递上下文并在用户离开后继续运行;Google 更新 Gemini managed agents,新增 Credentials API 和 Files API,称成本降低 30%、缓存命中提升 22%。
Google Research 发布新研究实验,让教育者借助生成式 UI(GenUI)动态生成符合教学目标的定制化互动学习模拟。目前已开放超过 30 个覆盖物理、化学、生物和数学的英语 STEM 学习互动样本,面向初高中,均由 AI 生成并经教师审核。
律所 Cooley 基于 ChatGPT Work 打造了 GO Public,将智能引入 IPO 流程。该工具帮助律师更早发现问题,把判断力集中在最关键之处。
OpenAI 推出 Astra for Law,为法律行业提供前沿智能支持。该产品包含定制化律所工作流、可连接的法律数据源,以及面向机密客户工作的法律级管控能力。
OpenAI 推出全新 AI 广告体验,包括 Sponsored Agents、面向营销人员的工具,以及与 HubSpot 和 Shopify 的集成。
OpenAI 介绍 ChatGPT Work 与 Codex analytics 两项分析能力,帮助团队了解 AI 使用与支出情况、发现培训需求,并将 AI 采用与业务成果关联起来。
OpenAI 介绍 Hex 的数据智能体借助 GPT-6 Astra 将分析结果转化为交互式可视化报告。这些可视化图表可以供员工分享,让复杂数据分析变得直观易读。
Mistral 与 Mozilla 宣布合作,Firefox Smart Window(beta)AI 浏览助手现已由 Mistral 模型驱动,首批面向法国和北美用户,英国和德国预计年内跟进。对话默认不保存在 Mozilla 服务器上,Mistral 承诺零数据保留,并基于区域语言、方言和文化语境对模型进行微调,让用户获得理解本地化差异的 AI 体验。
曼彻斯特大学与 NVIDIA 合作,将 Earth-2 CorrDiff 生成式降尺度模型用于全英空气污染预测,在英国国家 AI 超算 Isambard-AI 上用一年逐小时污染数据训练,仅 2 天即在单个 8-GPU 节点上完成,生成 2-3 平方公里分辨率的全英污染模型。
Salesforce 在 Dreamforce 上宣布其首个 CRM 推理模型 Koa,通过对 NVIDIA Nemotron 3 Super 进行后训练打造,因 NVIDIA Nemotron 开源,Salesforce 可在自己的基础设施内微调并运行模型,训练与推理均不使用任何客户数据。
NVIDIA 介绍 DSX 平台在 AI 工厂电力管理上的进展。Lambda 在 HGX B200 五机架 19 节点集群上验证 DSX MaxLPS,同样电力预算下集群 token 吞吐从约 400 万每秒提升到 500 万每秒。
NVIDIA 在 AI Infra Summit 上发布 Vera Rubin 与 DSX 平台的多项进展,主题是以每兆瓦 token 产出衡量 AI 工厂能效。
推荐理由:NVIDIA 官方汇总 Vera Rubin 与 DSX 平台在每兆瓦 token 产出上的多项合作实测数据,可帮助读者评估 AI 工厂能效方向。
IBM Research 在开源工具 ALTK-Evolve 中新增一致性指南与 Consistency Analyzer,针对平均准确率掩盖的可靠性问题。
Fyxer 基于 OpenAI 模型打造 AI 高管助理,通过微调、记忆和真实用户反馈来整理收件箱,并以每位用户的口吻起草邮件。
Cognition 在 Devin 中引入 GPT-6 Astra,用于改进 Devin 测试软件并验证其可用性的能力。目标是让工程师减少代码审查工作量、交付更多成果。
OpenAI 推出 ChatGPT Work 中的 Data agent,支持连接公司数据、发现洞察,并用自然语言构建交互式仪表盘。该功能面向企业数据分析场景,通过 AI 简化从数据到可视化呈现的流程。
OpenAI 推出 ChatGPT for Financial Services,内置金融数据并结合 GPT-6 Astra。它面向研究、建模和制作可直接交付客户的材料三类场景,面向金融行业提供服务。
Hugging Face 发布 Workflow1111,用 Gradio Workflow 画布重建 AUTOMATIC1111 的大部分功能,包含 11 条媒体流水线和 73 个节点。
OpenAI 推出 Agents API,一项由 Codex harness 驱动的托管服务,用于构建和启动云端智能体。该服务提供编排、长时间运行会话和工具使用能力。
一位 MIT 研究者使用 GPT-5.6 Sol 搭配 Codex,自主运行量子计算实验。它能分析实验结果并校准 qubit,展示了 AI 智能体在科研自动化中的应用。
Google DeepMind 于 9 月 8 日发布 AlphaGenome Atlas,包含人类基因组约 90 亿个单核苷酸变异的分子效应预测,数据集达 1 PB,是 AlphaFold Database 的 30 多倍。
推荐理由:原文给出平台规模、AVI 评分构成和免费学术入口,读者可据此评估它在变异解读和罕见病研究中的用法。
OpenAI 发布 ChatGPT Images 2.5,可将想法、草图和参考照片转化为更个性化、更精致的图像,更好地呈现用户的创意意图。
OpenAI 宣布扩大对新闻业的支持,面向学生、教育工作者、记者和新闻机构提供工具、培训与合作项目,覆盖从课堂到新闻编辑室的场景。
GitHub 推出 Project HydraFusion 研究预览,通过运行时多模型编排为每个任务生成执行计划,在 Single、Cascade、Critique 三种模式间选择以平衡质量、成本和延迟。
推荐理由:官方公布了 HydraFusion 的三种执行模式和三份基准的质量与成本数据,读者可以据此评估多模型编排对编码工作流的实际价值。
Legora 在财务审阅工作流中使用 GPT-6 Astra,数分钟内审阅了 41 份文档,并找出了全部四个预先埋设的错误。该工作流性能提升近 40%。
Hugging Face 发布开源工具 funes,为 Claude Code、Codex、pi、Hermes 等编码 agent 提供基于本机会话记录的持久记忆层。
推荐理由:Hugging Face 官方介绍 funes 的本地优先记忆层设计,给出跨 agent 共享记忆与成本对比,读者可评估是否接入自己的编码工作流。
Google 推出 Fairwind Program,向政府机构、Google Cloud 客户和网络安全合作伙伴提供先进网络防御能力。该计划将专用模型 Gemini 3.8 Flash Cyber 与 CodeMender 结合,可自主查找、验证并修复漏洞,在几分钟内生成可直接部署的补丁,运营成本远低于传统前沿模型。
Google DeepMind 发布 agentic video understanding 功能,覆盖 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite,通过智能体循环动态搜索和检视视频片段,替代固定帧率的静态处理。
推荐理由:官方公布了具体降本增效数字和 API 启用方式,开发者可据此评估长视频分析的成本与精度取舍。
Hugging Face WebAI 团队发布 @huggingface/kernels 库及 207 个 WebGPU 内核,每个内核以带版本、正确性与基准测试的独立仓库形式发布在 Hub 上,采用 Apache-2.0 许可。
推荐理由:官方发布 207 个 WebGPU 内核及加载库,并给出与 ORT WebGPU 的实测对比,读者可据此评估浏览器推理的加速空间。
Google DeepMind 推出 Gemini 3.5 Transcribe,定位为其最精准的实时语音转写模型,可清理语气词、自动格式化并识别自定义词表。
推荐理由:官方发布带具体 WER、延迟和 API 形态,开发者可据此评估语音转写与语音交互方案的选型。
Hugging Face 在 Gradio 中推出 gr.Workflow,把 AI 应用流水线变成类型化节点图,每个节点可运行、中间结果可见。
推荐理由:官方详解了 gr.Workflow 的节点图结构和 REST API 用法,读者可以据此判断如何把多步骤 AI 流水线搭成可拖拽、可部署的应用。
Google Research 推出 Biomarker Discovery Framework,一个在人类监督下迭代筛选可穿戴设备数据候选生物标志物的多智能体系统,结合假设生成、统计检验、对抗性验证与文献推理。
Liquid AI 为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 三个模型发布 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下提升解码速度。
推荐理由:原文给出三类模型的加速数字、质量不变的原理和 llama.cpp、SGLang 的接入命令,读者可据此评估端侧与 GPU 推理收益。
Mistral 发布 Agentic Search 检索层,通过 search、open、navigate、read、grep 五个工具实现多步检索循环,让模型在长文档和多数据源中查找、验证信息。
推荐理由:原文给出 FinanceBench 与 OfficeQA Pro 的具体精度、延迟和 token 数据,读者可据此评估检索方案是否迁移到自家场景。