Google Research 提出 Retrieve-for-Train,用扩散检索器绕过大模型推理瓶颈加速复杂 AI 搜索
Google Research 在 ICML 2026 论文中提出 Retrieve-for-Train 框架,通过离线 RL 将奖励对齐的查询 fan-out 编译为监督信号,蒸馏进 53.9M 参数的扩散检索器,实现单次非自回归查询扩展,免去测试时的 CoT 思考 token 开销。
Google Research 在 ICML 2026 论文中提出 Retrieve-for-Train 框架,通过离线 RL 将奖励对齐的查询 fan-out 编译为监督信号,蒸馏进 53.9M 参数的扩散检索器,实现单次非自回归查询扩展,免去测试时的 CoT 思考 token 开销。
Google Research 在 ACL 2026 提出 ToolGrad,采用“先答案后提问”的范式生成工具使用训练数据,通过文本“梯度”迭代构建 API 调用链,几乎达到 100% 通过率且成本更低。
Google Research 推出 GlucoFM,一个自监督双流架构的连续血糖监测(CGM)基础模型,将缓慢血糖趋势与短期波动分开建模。该模型在 109,066 小时无标注 CGM 数据上预训练,在 4 个队列、7 项临床预测任务共 14 项评估中,平均 PR-AUC 比最强基线 GluFormer 高 5.8 个百分点,并在餐后血糖反应预测中取得最低 MAE。
Multiverse Computing 发布论文 Quantization-Aware Healing,提出 QAH 方法:直接从压缩前的原始模型蒸馏,修复经过结构压缩并量化到 MXFP4 的模型。
IBM Research 在 AppWorld 上以同一 ReAct 智能体对比自家的 ALTK-Evolve 与 ACE,指出两者都拒绝压缩经验,差异在交付方式:ACE 每步注入完整 playbook,ALTK-Evolve 按模型能力选择性检索 guidelines。
Multiverse Computing 发布论文,用缓存教师模型 top-100 logits 的离线蒸馏和融合分块 KL 损失两项系统改动降低知识蒸馏成本。
Microsoft Research 推出 EvoLib,一个让大语言模型在推理时从自身经验自监督学习、无需更新模型的框架。它把成功方案提炼为可复用技能、把错误提炼为反思性洞见,并通过整合与动态加权机制持续演化知识。
Berkeley AI Research 提出 ABBEL 框架,将大语言模型在长程交互中的摘要形式化为自然语言信念状态,并通过信念评分监督其信息内容。在 CollabBench 协作编程环境中,基于重构的信念评分使 ABBEL-rec-BG 将与全上下文模型的性能差距缩小约 50%,训练步数从 100 减至 50,且峰值上下文 token 长度仍显著低于全上下文设置。
Google Research 发布大型传感器基础模型 SensorFM,在 500 万名同意参与者的超过一万亿分钟多模态可穿戴信号上自监督预训练。模型输入 PPG、加速度计、EDA、皮温和测高五类模态共 34 个一分钟聚合特征,采用 AIM 框架直接从不完整数据中学习。
推荐理由:Google 自述其可穿戴基础模型的数据规模、AIM 缺失数据处理方法与下游结果,读者可了解可穿戴健康数据通用表示的可行路径。
Hugging Face 提出 DiScoFormer,单个 Transformer 通过一次前向传播即可估计任意数据集背后的分布密度与 score,无需针对新分布重训。
Google Research 将在 COLM 2026 发表的论文发现,开启链式推理可让 Gemini-2.5(Flash 和 Pro)与 Qwen3-32B 召回推理关闭时几乎无法给出的单跳事实答案。
推荐理由:论文给出两类机制实验和幻觉审计结果,读者可以据此理解推理为何能帮助单跳事实召回以及其局限。
Import AI 第462期汇总多篇研究:牛津等机构四项实验共18,978次对话显示AI说服力稳定超过专家人类,Opus 4.1和Opus 4.6最强,真人募捐实验中AI比专业募捐者多筹10.8个百分点。
Google Research 在 AISTATS 2026 提出 Regularized f-Divergence Kernel Tests,一个用于审计机器遗忘的统计测试框架,比传统 two-sample testing 更灵敏灵活。
Google DeepMind 推出分布式训练架构 Decoupled DiLoCo,将训练拆分为异步通信的计算“孤岛”(learner units),隔离硬件故障对整体训练的影响。
Google Research 在 TMLR 论文中推出 Simula,一种 seedless、agentic 的“推理优先”合成数据生成框架,将数据集生成重构为机制设计问题,通过全局多样性、局部多样性、复杂化与双 critic 质量检查四个可控轴独立调控覆盖面、复杂度和质量。
Google Research 推出 ConvApparel 数据集,包含 4,000 多段服装购物领域的人机多轮对话(近 15,000 轮),用于量化 LLM 用户模拟器与真实人类行为的真实感差距。
Google Research 在论文 "Forest vs Tree: The (N,K) Trade-off in Reproducible ML Evaluation" 中研究了评测基准中条目数量与每条标注者人数的权衡。
Google Research 在 Earth AI 计划下推出 S2Vec,一个自监督框架,可将建筑环境转化为通用嵌入向量。它先用 S2 Geometry 将地球表面划分为分层 cell,再把特征栅格化为多层图像,并通过掩码自编码(MAE)无需人工标签地学习位置特征。
Berkeley AI Research 提出 SPEX 和 ProxySPEX 算法,利用稀疏性和低阶性等结构性质,以远少于传统方法的消融次数识别 LLM 中影响输出的特征、数据与内部组件交互。
Google Research 发布开放语音数据集 WAXAL,覆盖 27 种撒哈拉以南非洲语言,使用者超过 1 亿人、分布于 26 个国家。数据集包含约 1,846 小时经转写的自然语音(WAXAL-ASR,采用图像提示引发自发语音)和超过 565 小时高保真 TTS 录音,以 CC-BY-4.0 许可开放,由 Makerere 大学、加纳大学等非洲学术与社区组织主导采集。
Berkeley AI Research 的新论文为 word2vec 的学习过程提供了定量预测理论:证明在若干温和近似条件下,其学习问题可归约为无加权最小二乘矩阵分解,梯度流动力学可解析求解,最终学到的表示等价于对特定目标矩阵 $M^\star$ 做 PCA。