Google 发布 AgentHands:为 XR 空间对话生成同步手部手势的研究原型
Google 在 CHI 2026 发表 AgentHands,一个让 XR 中 AI 智能体生成与语音同步的 3D 手部手势的研究原型。系统由环境感知、手势事件库、手势嵌入推理和同步 XR 执行四个模块组成,将 LLM 输出映射为精准的空间动作。在 12 人被试内实验中,与纯语音基线相比,该手势显著提升了空间指代与交互效果。
Google 在 CHI 2026 发表 AgentHands,一个让 XR 中 AI 智能体生成与语音同步的 3D 手部手势的研究原型。系统由环境感知、手势事件库、手势嵌入推理和同步 XR 执行四个模块组成,将 LLM 输出映射为精准的空间动作。在 12 人被试内实验中,与纯语音基线相比,该手势显著提升了空间指代与交互效果。
IBM 发布 Granite 4.2 推理模型家族,包含 3B、8B、30B 三个 dense 尺寸,基于 Granite-4.1 基座(从头预训练约 15T tokens,五阶段策略将上下文窗口扩展至 512K tokens),经 CoT 与智能体轨迹数据的 SFT 后,再用异步 GRPO 多阶段 RL 流水线后训练。
推荐理由:官方完整披露 Granite 4.2 的五阶段预训练、SFT 配比与多阶段 RL 课程设计,读者可以直接对照复现其训练路线。
Multiverse Computing 发布论文 Quantization-Aware Healing,提出 QAH 方法:直接从压缩前的原始模型蒸馏,修复经过结构压缩并量化到 MXFP4 的模型。
Hugging Face 在 Gradio 中推出 gr.Workflow,把 AI 应用流水线变成类型化节点图,每个节点可运行、中间结果可见。
推荐理由:官方详解了 gr.Workflow 的节点图结构和 REST API 用法,读者可以据此判断如何把多步骤 AI 流水线搭成可拖拽、可部署的应用。
Mistral 与 HUMAIN 宣布在 AI 基础设施、先进模型开发与解决方案部署上开展战略合作,规模达数亿欧元。双方将推进模型开发与本地化,初期聚焦网络安全和语音,并开发阿拉伯语表现优异的前沿模型。Mistral 将探索使用 HUMAIN 数据中心基础设施,双方还计划在沙特针对受监管行业制定联合市场策略。
METR 研究发现 AI 对不同领域的加速并不均衡:网络安全漏洞报告大幅加速,数学研究小幅加速,而 AI 算法优化未发现可测量的加速。多所高校团队推出 SPADE,通过自我博弈共同进化环境合成与智能体能力,在 Qwen3-30B-A3B 上达到游戏套件平均分 58.3,较基线高 +5.3。
Google Research 推出 Biomarker Discovery Framework,一个在人类监督下迭代筛选可穿戴设备数据候选生物标志物的多智能体系统,结合假设生成、统计检验、对抗性验证与文献推理。
Google DeepMind 梳理其自 2010 年以来以游戏驱动 AI 研究的历程:DQN 掌握 49 款 Atari 2600 游戏,AlphaGo 2016 年击败李世石。
Google Research 推出 Mobility-Embedded POIs(ME-POIs)框架,将聚合、匿名的出行模式融入 Gemini 等语言模型生成的地点表示,捕捉 POI 的时间活动节奏。
Hugging Face 撰文介绍 Papers with Code 复活后的混合搜索系统如何构建:以 PostgreSQL 全文检索加 pgvector 语义召回,经加权 RRF 融合排序。
Hugging Face 发布研究,提出三种测试量化 ASR 模型的基准优化(benchmaxxing)现象。评估 11 个开源模型发现,部分高分模型会复现 VoxPopuli 与 LibriSpeech 的错误参考文本、在音频中数字被静音时仍以约 30-40% 的比例输出该数字,并通过声学线索切换拼写以匹配基准期望;在模型训练截止后新采集的同源音频上,这些行为明显减弱。
推荐理由:研究用三种探针量化了语音识别中的基准优化行为,为选型者提供了超越公开基准 WER 的评估思路。
Liquid AI 为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 三个模型发布 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下提升解码速度。
推荐理由:原文给出三类模型的加速数字、质量不变的原理和 llama.cpp、SGLang 的接入命令,读者可据此评估端侧与 GPU 推理收益。
Microsoft Research 发布深度学习 DFT 泛函 Skala 1.1,训练数据较前一版增加 2.5 倍,在 GMTKN55 基准的 55 个类别中 32 个排名第一,加权平均误差 2.8 kcal/mol,超过最昂贵的 global hybrid 泛函,同时保持 meta-GGA 级计算成本。
Mistral 发布 Agentic Search 检索层,通过 search、open、navigate、read、grep 五个工具实现多步检索循环,让模型在长文档和多数据源中查找、验证信息。
推荐理由:原文给出 FinanceBench 与 OfficeQA Pro 的具体精度、延迟和 token 数据,读者可据此评估检索方案是否迁移到自家场景。
IBM Research 在 Hugging Face Blog 发布 ALTK-Evolve 在 AppWorld 上跨八个模型的记忆校准研究,核心结论是智能体记忆不是开关而是按模型校准的剂量。
推荐理由:原文基于八个模型实测给出智能体记忆的剂量规律,弱模型靠精选检索、强模型用全集,兼顾精度与成本。
Hugging Face 发布教程介绍 Sentence Transformers v6.0 新增的 MultiVectorEncoder,PyLate、Stanford-NLP ColBERT 及 colpali-engine 检查点可直接加载。
推荐理由:官方详解 Sentence Transformers v6.0 新增多向量模型类型的用法,从原理、代价到索引和视觉文档检索都可落地操作。
Dharma AI 在 Hugging Face Blog 发布约束感知 GPU 分配器,与 FIFO 调度器在 7 个基准场景对比,GPU 利用率最高提升 33 个百分点,优先级加权产出平均提升 52%。该调度器将实时推理视为需求曲线而非峰值预留,批任务按优先级在 24 小时视野内规划,每次决策仅 1 至 15 毫秒,每个时间步只提交当前分配并每 30 至 60 分钟重跑以吸收预测误差。
DiG-bench 发布,一个由 70 款隐藏规则游戏组成的基准,测试模型通过探索发现环境规则的能力。Opus 5 和 Fable 5(配合 Claude Code)表现最好,是仅有的能在最难的 Tier 7 得分(0.2)的模型,但远低于人类 100% 的成绩。Inherent 则发布 Faraday,用较小的开源权重模型监督前沿模型做科学研究。
Google Research 提出 PhotoScan,一个研究性质的深度学习框架,可从普通 2D 智能手机照片估计体脂率(BF%)、Android-to-Gynoid 脂肪比(A/G)和内脏-皮下脂肪比(V/S)等三维身体成分指标。
Hugging Face 发布 2026 年 1 至 8 月开源模型生态观察报告:Hub 公开模型仓库从 243 万增至 296 万,中国实验室在多数月份发布的最大开源模型超过美国,Qwen 衍生模型达 151,448 个成为社区主要基座。
推荐理由:Hugging Face 用七个月的 Hub 数据量化开源模型生态的变化,读者可以据此核对中美发布策略、下载与关注度的错位以及 Agent 流量的真实构成。
Hugging Face 演示了 Strands Robots 中一个智能体如何完成机器人数据流闭环:从自然语言提示录制 LeRobotDataset 并同步到 Storage Buckets,训练时通过 stream_dataset 直接流式读取数据而无需下载,再以 mode="real" 一个关键字参数变更即可将 checkpoint 部署回硬件。
Google DeepMind 发布 Gemini 3.7 Flash,称其为迄今最智能的编码与 Agent 主力模型,距 Gemini 3.6 Flash 仅三周。
推荐理由:官方公布性能数据与新定价,开发者可对照基准数字和价格判断是否迁移现有工作流。
Hugging Face 复盘今年 7 月 15 日至 8 月 2 日举办的 ICML 2026 Open Reproductions 挑战赛:1,221 名社区成员用 Claude Code、Codex、Cursor 等智能体,19 天发布 6,816 份 Trackio 日志,尝试复现 2,226 篇论文,约占会议论文的 34%。
推荐理由:文中给出按声明逐条复核会议论文的结果分布和典型的证伪案例,读者可以借此理解智能体复现研究中人类角色的边界。
Hugging Face 的 OlmoEarth Studio 现已支持计算并导出开源 OlmoEarth 基础模型的 embedding 向量,用于相似性搜索、少样本分割等下游任务。
Microsoft Research 发布 MindTopo 基准,评估多模态大语言模型对连续性、分离、顺序、封闭和绳结五类拓扑概念的理解,涵盖静态推理与交互规划两个层级。测试显示,专有与开源模型在静态识别上明显优于交互式规划任务,且均远低于人类水平,错误多出现在规划阶段丢失结构关系。图像与视频生成工具仅在单帧内偶尔有帮助,难以在多步操作中保持拓扑约束。
Google DeepMind 发布多语言手语转文本(SL2T)模型,为 Gboard 和 Live Transcribe 带来手语转文字输入,率先支持 Pixel 11 上的 ASL 转英语。
推荐理由:官方说明模型训练规模、基准成绩和隐私设计,读者可了解手语翻译落地的技术路径与现存限制。
Google Research 发布 knowledge profiling 行为框架和 WikiProfile 基准(2,150 条 Wikipedia 事实,每条配 10 个任务),评估 13 个 LLM。
推荐理由:原文用知识画像方法区分编码与召回失败,给出 frontier 模型事实错误主因是召回的关键数据。
Google Research 推出 AMIE (Video),基于 Gemini 和 Project Astra 的实时视频临床问诊系统,采用 Talker、Planner、Perception 三个并行智能体的异步架构。
推荐理由:原文给出多智能体架构设计与大规模随机对照评估结果,读者可以了解实时音视频临床 AI 的实现路径与现有局限。
微软研究院发布研究模型 CARE-X,一个统一的胸部 X 光 VLM,结合生成式与判别式双推理,支持报告生成、疾病定位、多标签分类等多样临床解读任务。该模型采用 DAPO 强化学习在多任务设置中奖励临床正确性,并在 Narayana Health 的真实印度临床数据上验证。另一项独立实验将 Qwen3-VL-4B-Instruct 与确定性测量工具配对,评估直接计算能否提升测量依赖病灶的表现。
IBM Research 在 AppWorld 上以同一 ReAct 智能体对比自家的 ALTK-Evolve 与 ACE,指出两者都拒绝压缩经验,差异在交付方式:ACE 每步注入完整 playbook,ALTK-Evolve 按模型能力选择性检索 guidelines。
Mistral 宣布三项主权 AI 举措:Mistral Regional Endpoints 正式可用,可选择推理在 Europe 或 US 运行;Mistral Priority Tier 公开预览,提供自定义速率限制和 uptime SLA。
NVIDIA 发布 Magpie TTS Multilingual 开放权重模型,参数量 364M,新增现代标准阿拉伯语、韩语和巴西葡萄牙语,共支持 12 种语言,并提供生产级 NIM 部署容器。
推荐理由:原文给出TTFA延迟数据和架构改进细节,读者可据此评估自部署级联语音方案相对一体化语音模型的取舍。
智库 IFP 发布 23 项“低后悔”政策建议,分 7 大类,帮助政策制定者应对 AI 研发自动化的风险,包括提升自动化 AI 研发透明度、发展 AI 验证技术、投资 AI 韧性等。
Multiverse Computing 发布论文,用缓存教师模型 top-100 logits 的离线蒸馏和融合分块 KL 损失两项系统改动降低知识蒸馏成本。
Meta 于今日发布 Muse Glimmer,一个从 Muse 蒸馏而来的 30B 多模态开源模型,采用 Apache 2.0 许可,面向本地隐私敏感的 Agentic 场景如编码、文档分析和个人助手。
推荐理由:官方介绍可帮助读者了解这个 30B 本地多模态模型在 Agentic 基准上的表现与本地部署路径。
Google DeepMind 在 Nature 发表论文并开源 WeatherNext 2 和 WeatherNext Cyclones 模型,称其对气旋路径、强度和风结构的预报平均比现有模型多出约 24 小时提前量,相当于约十年气象学进展。
推荐理由:官方同时放出 Nature 论文与模型权重,读者可按论文结果自行复用或验证这套气旋预报方法。
Baseten 正式成为 Hugging Face Hub 的 Inference Provider,为 Hub 上的 serverless 推理提供支持,首发支持对话与文本生成任务,涵盖 Kimi K3、DeepSeek V4 Flash、GLM-5.2 等开源权重 LLM。
Mistral 发布 3B 开源权重多模态安全分类器 Shieldstral,将内容审核建模为策略自适应的问答任务,在推理时接受自然语言策略并输出校准的安全分数。该模型在文本安全上匹敌最大 7 倍于其体量的开放护栏模型,在多模态审核上创造新 SOTA,以 Apache 2.0 协议开放权重,可在单张 16GB GPU 上运行。
推荐理由:原文给出把内容审核改写成策略自适应问答的建模思路和数据构建方法,对做安全分类器的团队有可迁移的参考价值。
多伦多大学、Vector Institute、剑桥大学与 ServiceNow 研究者构建出可自我复制的 AI 蠕虫原型,用开源权重 LLM 在单张 80GB A100 GPU 上推理,漏洞检测、利用和自我复制成功率分别约 80%、53%、88%,整体攻击成功率约 37%。
Google Research 发布 Chain-of-Evidence 可验证性框架及其实例 Science One Framework,配套 CoE Audit 自动审计指标。