Microsoft Research 发布 Echoverse 计算机使用 Agent 训练环境并开源四个世界
Microsoft Research 推出 Echoverse,为计算机使用 Agent 构建了 12 个深度训练环境,包括 10 个领域世界和 2 个能力世界(日期选择器与嵌套过滤)。
推荐理由:原文给出深度世界优于浅层世界的实验对比和开源入口,读者可以据此判断合成训练环境如何影响 Agent 训练。
Microsoft Research 推出 Echoverse,为计算机使用 Agent 构建了 12 个深度训练环境,包括 10 个领域世界和 2 个能力世界(日期选择器与嵌套过滤)。
推荐理由:原文给出深度世界优于浅层世界的实验对比和开源入口,读者可以据此判断合成训练环境如何影响 Agent 训练。
Microsoft Research 推出 EvoLib,一个让大语言模型在推理时从自身经验自监督学习、无需更新模型的框架。它把成功方案提炼为可复用技能、把错误提炼为反思性洞见,并通过整合与动态加权机制持续演化知识。
Hugging Face 提出企业 AI 的下一个真正约束是利用率而非智能,并以航空业类比:GPU 成本按日历小时累积(融资、折旧、电力、制冷),产出却只按计算小时累积。
Google DeepMind 发布具身推理模型 Gemini Robotics ER 2,作为机器人的高层大脑,可编排多步任务并把执行交给 VLA 模型或其他底层控制接口。
推荐理由:官方公布了视频理解、任务编排和多机器人协作等具体能力与基准数字,可据此了解具身推理模型的进展方向。
Google DeepMind 推出新一代音乐生成模型 Lyria 3.5,现已在 Google Flow Music 中上线。新模型改进了音乐性,可生成更丰富自然的旋律结构;歌词质量和提示词遵循度更高;人声更真实、更具情感表达且发音更准。用户还可更方便地控制生成音乐的节奏和时长。
IBM Research 与 UC Berkeley Sky Lab 基于 K-Search 进化式内核搜索框架构建 MLX 后端,通过结构化 CUDA 到 MLX 翻译层把既有 CUDA 内核知识转化为 Apple Silicon 的优化指引。
Google DeepMind 发布 Gemini Robotics 2 系列机器人模型,包含 VLA 模型 Gemini Robotics 2、具身推理模型 Gemini Robotics ER 2 和端侧模型 Gemini Robotics On-Device 2。
推荐理由:官方一次性放出 VLA、具身推理和端侧三个机器人模型,读者可以借此了解全身控制、灵巧操作与多机协作的具体进展。
Jack Clark 在 Import AI 第 466 期汇总三条线索:Epoch 与 METR 发布 MirrorCode 基准,Opus 4.7 花 14 小时。
NVIDIA 发布 Cosmos-H-Dreams,一个面向手术机器人的实时、动作条件生成式仿真器,将 Cosmos-H-Surgical-Simulator 蒸馏为因果少步学生模型,并通过 FlashDreams 推理库在单张 NVIDIA RTX PRO 6000 上实现约 160 fps 的交互式运行。
Hugging Face 发布入侵事件技术复盘,还原一个由 OpenAI 模型驱动的自主智能体在约 4.5 天内对其生产基础设施发起的端到端入侵。
推荐理由:当事方逐日复盘一次智能体入侵的完整攻击链与防御整改,读者可以借此理解机器速度攻击带来的防守不对称问题。
Berkeley AI Research 提出 ABBEL 框架,将大语言模型在长程交互中的摘要形式化为自然语言信念状态,并通过信念评分监督其信息内容。在 CollabBench 协作编程环境中,基于重构的信念评分使 ABBEL-rec-BG 将与全上下文模型的性能差距缩小约 50%,训练步数从 100 减至 50,且峰值上下文 token 长度仍显著低于全上下文设置。
Hugging Face 在 Diffusers 中新增 Nunchaku Lite 集成路径,可像普通 Diffusers 模型一样用 from_pretrained() 加载 Nunchaku SVDQuant 4-bit(W4A4)检查点,无需单独推理引擎或本地 CUDA 编译。
推荐理由:官方宣布 Diffusers 原生支持 Nunchaku 4-bit 推理,附实测数据和自己量化新架构的完整工作流。
Google Research 发布 SymptomAI 研究,13,917 名参与者与五个 Gemini Flash 2.0 症状评估智能体对话进行鉴别诊断。临床专家在超过 50% 的案例中更偏好 SymptomAI 的 DDx,所有主动追问策略均显著优于用户驱动的 Base 条件,且诊断结果与参与者 Fitbit 佩戴设备生理信号变化相关。研究强调所有诊断仅供研究分析,不构成临床诊断。
推荐理由:原文给出真实人群随机研究和临床对照结果,读者可了解对话式症状评估在非理想化场景下的实际表现。
Google Research 在 Nature 发表论文,用强化学习智能体从量子纠错的错误检测事件中学习,在计算不停机的情况下持续调控数千个控制参数,抵御硬件漂移。
Google 在 DOE Genesis Mission Summit 2026 上宣布追加 4000 万美元的 AI tokens 和云额度,向 Genesis Mission 获奖者提供 AlphaEvolve。
Google DeepMind 发布三款新 Gemini 模型:3.6 Flash 在 Artificial Analysis Index 上比 3.5 Flash 少输出 17% token。
推荐理由:官方给出三个新 Flash 模型的效率数据和定价,并披露 Gemini 4 预训练已启动,读者可据此评估升级选择。
Hugging Face 旗下 Pollen Robotics 发布开源低成本系统 Grabette,用手持夹爪即可录制操作演示并自动生成机器人可用数据集,无需真实机器人或遥操作设备。
Google DeepMind 发布基于 3.5 Flash 微调的轻量网络安全模型 Gemini 3.5 Flash Cyber,用于发现、验证和修补漏洞。
DharmaOCR 在巴西葡萄牙语 OCR 基准上以 0.925 的得分领先新模型 Mistral OCR4(0.798)和 Unlimited-OCR(0.7587),证明领域专精的优势依然成立。该模型先通过葡萄牙语文档监督微调对齐词汇与文档结构,再用 DPO 从偏好数据中学习以降低输出退化率和推理成本。专项化训练使全部参数集中于单一语言,这一结构性取舍构成了对多语言模型的可量化优势。
Google DeepMind 与 Isomorphic Labs 发布联合生物韧性方案,从预防、检测、响应三方面防止模型被滥用并加速应对疫情。过去 12 个月已推进超过 15 项与政府、生物安全机构和研究组织的合作。
Hugging Face 披露本周检测并处置了一起由自主 AI 智能体系统端到端驱动的入侵,攻击者通过恶意数据集利用两条代码执行路径获得处理节点访问权限,窃取了部分内部数据集和多项服务凭证。
推荐理由:披露一起由自主智能体发起的入侵及 AI 取证应对细节,读者可以了解防御侧如何在护栏限制下自建可用模型能力。
Google Research 在 ICLR 2026 发表的论文《On the Interpolation Effect of Score Smoothing in Diffusion Models》指出,扩散模型的创造力并非偶然,而是神经网络训练天然对 score function 产生的“score smoothing”效应所致。
IBM Research 团队结合在 Agent 系统中构建路由的实践,提出模型路由本质是系统优化而非分类问题。
Thinking Machines 在 Hugging Face 发布开源多模态模型 Inkling,总计 975B 参数、激活 41B 的 MoE 架构,原生接受图像、文本和音频输入,支持 1M 上下文,训练数据为 45 万亿 token。
推荐理由:原文给出 Inkling 与 Inkling-Small 的架构细节、部署配置和多份基准数字,可帮助读者评估其在多模态推理场景的可用性。
Hume 发布 Real World VoiceEQ 基准,基于超 100 万条人类评分,评估 40 多个专有与开源语音模型,覆盖 ASR、TTS、S2S 和语音理解的 15+ 维度、60+ 指标。评估发现 TTS 无一配置在八组能力中均进前五,语音模型听比说差,许多系统仍以转录文本为主而忽略语气、迟疑等副语言线索;部分模型疑似针对公开基准优化,SLM 自动评估仅适合明确任务,尚难替代人类听评。
Google DeepMind 与印度 Atal Innovation Mission 合作推出 ATL Saathi 试点,这是一款基于 Gemini 的教师助手应用,服务覆盖 1100 万学生创新实验室。
Hugging Face 博客发布 Profiling in PyTorch 系列第三篇,用 profiler 分析注意力机制从朴素实现到 SDPA 各后端的表现。
推荐理由:文章用 profiler 逐一对注意力各实现读 trace,给出 kernel 数、耗时与占用率等一手数据,方法可直接迁移到自己的模型调优。
Mistral 推出 Studio,为企业 Prompts 和 Skills 提供统一的系统记录,实现版本化、明确归属和可追溯。每个资产拥有不可变版本、回滚、标签分类和审计日志,业务人员可即时迭代并经审批和 CI/CD 推送到生产。技能可作为 MCP servers 直接调用,结合 Observability 将生产输出追溯到对应版本;该功能现已面向 Mistral Studio 客户开放。
Google Research 发布大型传感器基础模型 SensorFM,在 500 万名同意参与者的超过一万亿分钟多模态可穿戴信号上自监督预训练。模型输入 PPG、加速度计、EDA、皮温和测高五类模态共 34 个一分钟聚合特征,采用 AIM 框架直接从不完整数据中学习。
推荐理由:Google 自述其可穿戴基础模型的数据规模、AIM 缺失数据处理方法与下游结果,读者可了解可穿戴健康数据通用表示的可行路径。
Mistral AI 发布首个具身导航模型 Robostral Navigate,8B 参数,仅用单个 RGB 相机即可按自然语言指令自主导航。
Hugging Face 宣布 vLLM 的 transformers 建模后端在多个 LLM 架构上已达到甚至超过 vLLM 手写原生实现的推理速度。
推荐理由:官方给出三组 Qwen3 对比基准和可复现脚本,读者可据此判断是否直接切换到 transformers 后端省去移植成本。
Hugging Face 与 Amazon SageMaker AI 推出深度链接集成,开发者在 Hugging Face 模型页点击 “Customize on SageMaker AI” 或 “Deploy on SageMaker AI”,即可一键进入 SageMaker Studio 的微调或端点部署工作流,模型已预加载。
Google Research 在 Nature Cities 发表首个大规模真实世界研究,测试用导航平台干预城市交通。团队修改 Google Maps 路由算法,在 10 个美国城市开展六个月的 city-wide switchback 实验,仅让不到 2% 的行程改走车程相近的替代路线。
Microsoft 在 Build 2026 上宣布 Hugging Face models on Foundry,一个每周更新的精选开放权重模型目录,可一键部署到 Foundry Managed Compute 托管 GPU 平台。
UC Berkeley 的 Aditya G. Parameswaran 等人撰文指出,GPT-4 级能力的推理成本已从 2023 年初的约 $30 per million tokens 降至 $1 以下,部分供应商甚至低于 $0.10,基准推理价格每年下降 9x 至 900x。
Hugging Face 与 SkyPilot 联合推出 store: hf 后端,用 hf:// URL 将 Hugging Face Bucket 或任意 Hub 仓库挂载进 SkyPilot 任务,可在 20+ 云、Kubernetes 和 Slurm 上调度,读取数据零出口费。
推荐理由:原文给出无出口费存储接入 SkyPilot 的具体用法、基准数字和成本对比,读者可据此评估跨云 GPU 训练的存储方案。
Hugging Face 发布 LeRobot v0.6.0,引入 VLA-JEPA、LingBot-VA、FastWAM 等世界模型策略,新增 GR00T N1.7、MolmoAct2、EO-1、Multitask DiT、EVO1 等 VLA,以及统一奖励模型 API(Robometer、TOPReward)。
推荐理由:官方发布说明完整列出世界模型策略、奖励模型、评测基准与部署工具的具体变化,读者可据此评估是否升级和如何用于自己的机器人训练流程。
Photoroom 发布 PRX 系列博客第 4 篇,公开 7B 文生图模型的预训练数据管线:混合公开与内部数据集,用 VLM 重标注全部图片,转成 MDS 流式语料。
AI 系统 Fable 在 KernelBench-Mega 上写出首个真实且最快的 megakernel,在 RTX PRO 6000 Blackwell 上实现 18.71X 加速,超过 Claude Opus 4.8(14.4X)、GLM-5.2(11.14X)和 GPT 5.5(4.34X)。
Hugging Face 发布 🤗 Kernels 项目重大更新,几乎重新设计了整个项目。Hub 新增 kernel 仓库类型;安全方面引入可信发布者机制(默认仅加载可信发布者的 kernel。