Google Research 发布 AI 视频联合导演框架,实现连贯的长篇视频生成
Google Research 推出 AI 视频联合导演研究,基于 Gemini 和 Veo 构建统一多智能体框架,包含 Co-Director、CANVAS、A²RD 和 VQQA 四套框架,将长视频生成建模为全局优化与世界状态跟踪问题。
Google Research 推出 AI 视频联合导演研究,基于 Gemini 和 Veo 构建统一多智能体框架,包含 Co-Director、CANVAS、A²RD 和 VQQA 四套框架,将长视频生成建模为全局优化与世界状态跟踪问题。
Google Research 与 HHMI Janelia、MRC 分子生物学实验室及剑桥大学等合作,在 Cell 发表雄性果蝇大脑与中枢神经系统的完整连接组,包含超过 166,000 个神经元和 1.25 亿个突触连接,是目前按神经元数量计最大的大脑图谱。
推荐理由:官方团队说明了这份连接组图谱的规模、验证方式和可视化工具,读者可以了解它与雌性图谱互补后的研究用途。
Google 与 NASA JPL 在 PNAS 发表 MAPL-EMIT,一个基于 Swin-S vision transformer 的深度学习框架,用 EMIT 高光谱数据自动检测、量化并定位全球甲烷羽流。
Google 在 CHI 2026 发表 AgentHands,一个让 XR 中 AI 智能体生成与语音同步的 3D 手部手势的研究原型。系统由环境感知、手势事件库、手势嵌入推理和同步 XR 执行四个模块组成,将 LLM 输出映射为精准的空间动作。在 12 人被试内实验中,与纯语音基线相比,该手势显著提升了空间指代与交互效果。
Google Research 推出 Mobility-Embedded POIs(ME-POIs)框架,将聚合、匿名的出行模式融入 Gemini 等语言模型生成的地点表示,捕捉 POI 的时间活动节奏。
Google Research 提出 PhotoScan,一个研究性质的深度学习框架,可从普通 2D 智能手机照片估计体脂率(BF%)、Android-to-Gynoid 脂肪比(A/G)和内脏-皮下脂肪比(V/S)等三维身体成分指标。
Microsoft Research 发布 MindTopo 基准,评估多模态大语言模型对连续性、分离、顺序、封闭和绳结五类拓扑概念的理解,涵盖静态推理与交互规划两个层级。测试显示,专有与开源模型在静态识别上明显优于交互式规划任务,且均远低于人类水平,错误多出现在规划阶段丢失结构关系。图像与视频生成工具仅在单帧内偶尔有帮助,难以在多步操作中保持拓扑约束。
Google Research 公布了关于 AI 皮肤科信息工具的多项研究,发表于 JAMA Dermatology 等期刊。一项 2,345 人参与的实验显示,借助 AI 工具的用户病症识别准确率达 23%,约为普通搜索对照组(8%)的三倍;接近医生"ground truth"的 "Wizard of Oz" 组达 36%。
Google Research 的 MoGen 模型用点云流匹配生成合成神经形态,加入 PATHFINDER 训练数据后使重建错误率降低 4.4%,主要减少 merge 错误。在完整小鼠大脑尺度上,这相当于节省 157 人年的手工校对工作。该研究将在 ICLR 2026 发表,MoGen 已开源。
Google Research 在 Earth AI 计划下推出 S2Vec,一个自监督框架,可将建筑环境转化为通用嵌入向量。它先用 S2 Geometry 将地球表面划分为分层 cell,再把特征栅格化为多层图像,并通过掩码自编码(MAE)无需人工标签地学习位置特征。