Google 发布 AgentHands:为 XR 空间对话生成同步手部手势的研究原型
Google 在 CHI 2026 发表 AgentHands,一个让 XR 中 AI 智能体生成与语音同步的 3D 手部手势的研究原型。系统由环境感知、手势事件库、手势嵌入推理和同步 XR 执行四个模块组成,将 LLM 输出映射为精准的空间动作。在 12 人被试内实验中,与纯语音基线相比,该手势显著提升了空间指代与交互效果。
Google 在 CHI 2026 发表 AgentHands,一个让 XR 中 AI 智能体生成与语音同步的 3D 手部手势的研究原型。系统由环境感知、手势事件库、手势嵌入推理和同步 XR 执行四个模块组成,将 LLM 输出映射为精准的空间动作。在 12 人被试内实验中,与纯语音基线相比,该手势显著提升了空间指代与交互效果。
Google Research 推出 Biomarker Discovery Framework,一个在人类监督下迭代筛选可穿戴设备数据候选生物标志物的多智能体系统,结合假设生成、统计检验、对抗性验证与文献推理。
Google DeepMind 梳理其自 2010 年以来以游戏驱动 AI 研究的历程:DQN 掌握 49 款 Atari 2600 游戏,AlphaGo 2016 年击败李世石。
Google Research 推出 Mobility-Embedded POIs(ME-POIs)框架,将聚合、匿名的出行模式融入 Gemini 等语言模型生成的地点表示,捕捉 POI 的时间活动节奏。
Google Research 提出 PhotoScan,一个研究性质的深度学习框架,可从普通 2D 智能手机照片估计体脂率(BF%)、Android-to-Gynoid 脂肪比(A/G)和内脏-皮下脂肪比(V/S)等三维身体成分指标。
Google DeepMind 发布 Gemini 3.7 Flash,称其为迄今最智能的编码与 Agent 主力模型,距 Gemini 3.6 Flash 仅三周。
推荐理由:官方公布性能数据与新定价,开发者可对照基准数字和价格判断是否迁移现有工作流。
Google DeepMind 发布多语言手语转文本(SL2T)模型,为 Gboard 和 Live Transcribe 带来手语转文字输入,率先支持 Pixel 11 上的 ASL 转英语。
推荐理由:官方说明模型训练规模、基准成绩和隐私设计,读者可了解手语翻译落地的技术路径与现存限制。
Google Research 发布 knowledge profiling 行为框架和 WikiProfile 基准(2,150 条 Wikipedia 事实,每条配 10 个任务),评估 13 个 LLM。
推荐理由:原文用知识画像方法区分编码与召回失败,给出 frontier 模型事实错误主因是召回的关键数据。
Google Research 推出 AMIE (Video),基于 Gemini 和 Project Astra 的实时视频临床问诊系统,采用 Talker、Planner、Perception 三个并行智能体的异步架构。
推荐理由:原文给出多智能体架构设计与大规模随机对照评估结果,读者可以了解实时音视频临床 AI 的实现路径与现有局限。
Google DeepMind 在 Nature 发表论文并开源 WeatherNext 2 和 WeatherNext Cyclones 模型,称其对气旋路径、强度和风结构的预报平均比现有模型多出约 24 小时提前量,相当于约十年气象学进展。
推荐理由:官方同时放出 Nature 论文与模型权重,读者可按论文结果自行复用或验证这套气旋预报方法。
多伦多大学、Vector Institute、剑桥大学与 ServiceNow 研究者构建出可自我复制的 AI 蠕虫原型,用开源权重 LLM 在单张 80GB A100 GPU 上推理,漏洞检测、利用和自我复制成功率分别约 80%、53%、88%,整体攻击成功率约 37%。
Google Research 发布 Chain-of-Evidence 可验证性框架及其实例 Science One Framework,配套 CoE Audit 自动审计指标。
Google DeepMind 发布具身推理模型 Gemini Robotics ER 2,作为机器人的高层大脑,可编排多步任务并把执行交给 VLA 模型或其他底层控制接口。
推荐理由:官方公布了视频理解、任务编排和多机器人协作等具体能力与基准数字,可据此了解具身推理模型的进展方向。
Google DeepMind 推出新一代音乐生成模型 Lyria 3.5,现已在 Google Flow Music 中上线。新模型改进了音乐性,可生成更丰富自然的旋律结构;歌词质量和提示词遵循度更高;人声更真实、更具情感表达且发音更准。用户还可更方便地控制生成音乐的节奏和时长。
Google DeepMind 发布 Gemini Robotics 2 系列机器人模型,包含 VLA 模型 Gemini Robotics 2、具身推理模型 Gemini Robotics ER 2 和端侧模型 Gemini Robotics On-Device 2。
推荐理由:官方一次性放出 VLA、具身推理和端侧三个机器人模型,读者可以借此了解全身控制、灵巧操作与多机协作的具体进展。
Google Research 发布 SymptomAI 研究,13,917 名参与者与五个 Gemini Flash 2.0 症状评估智能体对话进行鉴别诊断。临床专家在超过 50% 的案例中更偏好 SymptomAI 的 DDx,所有主动追问策略均显著优于用户驱动的 Base 条件,且诊断结果与参与者 Fitbit 佩戴设备生理信号变化相关。研究强调所有诊断仅供研究分析,不构成临床诊断。
推荐理由:原文给出真实人群随机研究和临床对照结果,读者可了解对话式症状评估在非理想化场景下的实际表现。
Google Research 在 Nature 发表论文,用强化学习智能体从量子纠错的错误检测事件中学习,在计算不停机的情况下持续调控数千个控制参数,抵御硬件漂移。
Google 在 DOE Genesis Mission Summit 2026 上宣布追加 4000 万美元的 AI tokens 和云额度,向 Genesis Mission 获奖者提供 AlphaEvolve。
Google DeepMind 发布三款新 Gemini 模型:3.6 Flash 在 Artificial Analysis Index 上比 3.5 Flash 少输出 17% token。
推荐理由:官方给出三个新 Flash 模型的效率数据和定价,并披露 Gemini 4 预训练已启动,读者可据此评估升级选择。
Google DeepMind 发布基于 3.5 Flash 微调的轻量网络安全模型 Gemini 3.5 Flash Cyber,用于发现、验证和修补漏洞。
Google DeepMind 与 Isomorphic Labs 发布联合生物韧性方案,从预防、检测、响应三方面防止模型被滥用并加速应对疫情。过去 12 个月已推进超过 15 项与政府、生物安全机构和研究组织的合作。
Google Research 在 ICLR 2026 发表的论文《On the Interpolation Effect of Score Smoothing in Diffusion Models》指出,扩散模型的创造力并非偶然,而是神经网络训练天然对 score function 产生的“score smoothing”效应所致。
Google DeepMind 与印度 Atal Innovation Mission 合作推出 ATL Saathi 试点,这是一款基于 Gemini 的教师助手应用,服务覆盖 1100 万学生创新实验室。
Google Research 发布大型传感器基础模型 SensorFM,在 500 万名同意参与者的超过一万亿分钟多模态可穿戴信号上自监督预训练。模型输入 PPG、加速度计、EDA、皮温和测高五类模态共 34 个一分钟聚合特征,采用 AIM 框架直接从不完整数据中学习。
推荐理由:Google 自述其可穿戴基础模型的数据规模、AIM 缺失数据处理方法与下游结果,读者可了解可穿戴健康数据通用表示的可行路径。
Google Research 在 Nature Cities 发表首个大规模真实世界研究,测试用导航平台干预城市交通。团队修改 Google Maps 路由算法,在 10 个美国城市开展六个月的 city-wide switchback 实验,仅让不到 2% 的行程改走车程相近的替代路线。
Hugging Face 与 Cerebras 发布一个模块化、开源的实时语音对话(speech-to-speech)流水线,用 Cerebras 的高速推理解决语言模型响应延迟瓶颈。
推荐理由:原文给出了完整开放的级联语音对话架构和各层组件,开发者可以照此搭建或替换自己的实时语音 AI 流水线。
Google Research 发布覆盖 50 多个全球城市的建筑级屋顶反照率数据集,并通过新的高分辨率 Heat Resilience Earth Engine App 开放访问。
Google DeepMind 发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image),4 秒生成 1K 图像、每张 $0.034,上线 Google AI Studio、Gemini API 等平台。
推荐理由:官方给出两款新模型的价格、延迟和限制等具体参数,开发者可以据此评估替换现有模型的成本收益。
Google Research 发布面向表格数据分类与回归的基础模型 TabFM,将表格预测建模为上下文学习问题,无需手动训练、调参和特征工程,单次前向传播即可对未见表格生成预测。
Google 通过为冻结权重的 Gemini Nano v3 模型附加轻量 MTP head,实现端侧推理提速,已部署到 Pixel 9 和 10 系列。该 zero-copy 架构直接复用主模型的 KV cache,每个实例节省 130MB 内存,且因错误草稿会在验证中被丢弃,输出与主模型逐位一致。
Google Research 在 CIDR 发表线性弹性缓存方法,把页面逐出建模为“滑雪租赁”问题,用轻量级机器学习动态调整缓存大小,以最小化缓存管理总拥有成本(TCO)。该方法已在 Spanner 生产服务器上集成数月,相比固定大小缓存,内存占用降低 15.5%,cache miss 仅增加 5.5%,TCO 约降 5%,实际 I/O 成本影响仅 0.5%。
Google Research 将在 COLM 2026 发表的论文发现,开启链式推理可让 Gemini-2.5(Flash 和 Pro)与 Qwen3-32B 召回推理关闭时几乎无法给出的单跳事实答案。
推荐理由:论文给出两类机制实验和幻觉审计结果,读者可以据此理解推理为何能帮助单跳事实召回以及其局限。
Google DeepMind 宣布 computer use 成为 Gemini 3.5 Flash 的内置工具,此前该能力仅以独立的 Gemini 2.5 computer use 模型提供。
推荐理由:官方说明 computer use 从独立模型并入 Gemini 3.5 Flash 主模型的定位变化,并给出配套安全机制与使用入口,读者可据此评估迁移时机。
Import AI 第462期汇总多篇研究:牛津等机构四项实验共18,978次对话显示AI说服力稳定超过专家人类,Opus 4.1和Opus 4.6最强,真人募捐实验中AI比专业募捐者多筹10.8个百分点。
Google DeepMind 正与英国政府、Google Cloud、Faculty 及 Barnet、Dorset、Camden 三个地方规划部门合作,基于 Gemini 开发 AI 规划原型,目标是把住宅类规划申请的处理时间缩短 50%。
Google Research 在 Farmscapes 2020 栅格地图基础上,发布英国树篱、石墙和小林地的矢量化数据集,用于自然修复与碳核算。
Google DeepMind 发布 AI Control Roadmap,把内部 AI 智能体视为潜在未对齐的"内部威胁",在模型对齐之上增加系统级安全保障。
推荐理由:官方详细公开其纵深防御的 AI 控制路线图,包含威胁建模、监测指标和已落地的监控原型细节,可供安全实践参考。
Google Research 公布了关于 AI 皮肤科信息工具的多项研究,发表于 JAMA Dermatology 等期刊。一项 2,345 人参与的实验显示,借助 AI 工具的用户病症识别准确率达 23%,约为普通搜索对照组(8%)的三倍;接近医生"ground truth"的 "Wizard of Oz" 组达 36%。
Google Research 在 AISTATS 2026 提出 Regularized f-Divergence Kernel Tests,一个用于审计机器遗忘的统计测试框架,比传统 two-sample testing 更灵敏灵活。
Google DeepMind 发布开源实验模型 DiffusionGemma,采用 26B 总参数、3.8B 激活的 MoE 扩散架构,在专用 GPU 上文本生成最高提速 4 倍,单块 NVIDIA H100 超过 1000 tokens/s,RTX 5090 超过 700 tokens/s。
推荐理由:官方给出扩散文本生成的速度数据、显存占用与质量取舍,适合评估本地交互场景的落地条件。