跳到正文

#论文/研究

今日 1 条
今天9月30日周三
  1. Google Research42

    Google Research 提出 Diffusion Controller:统一并简化 AI 图像生成控制

    Google Research 提出 Diffusion Controller 框架,将去噪过程重构为连续控制问题,用轻量级"转向阻尼"网络在不改动基座模型的情况下引导生成。基于 Stable Diffusion v1.4 的实验用 HPS-v2 评测,涵盖 SFT、RWL 和 PPO 三种微调方式,其完全解锁版本相对基线模型达到 90% 胜率,并且能在不接触底层代码的情况下控制闭源模型。

9月29日周二
9月25日周五
9月24日周四
  1. Microsoft Research53

    Microsoft Research 研究显示将机器人 AI 推理卸载到边缘或云端可提升性能与续航

    Microsoft Research 通过系统性测量研究指出,仅依赖机器人机载 GPU 会限制性能、续航与可扩展性。实验显示小型 GPU 上地图与规划最高慢 383%,导航障碍及时检测率下降 30%,VLA 模型准确率下降 50%;换成 Raspberry Pi-5 并卸载推理可显著延长电池时间,Jetson Thor 等机载 GPU 对机器人的电池消耗高达 160%。

9月23日周三
9月21日周一
  1. Microsoft Research58

    Microsoft Research 发布逆合成模型 RetroChimera 并在 Nature 发表论文

    Microsoft Research 在 Nature 发表逆合成预测框架 RetroChimera,并开源实现和权重(MIT 许可,GitHub 和 Microsoft Foundry 可用)。模型由 R-SMILES 2 和 NeuralLoc 两个子模型通过 learning-to-rank 集成,盲测中 PhD 级化学家更偏好其单步预测,10 个挑战性目标中完成 9 个,优于子模型和基线。

9月19日周六
  1. Google Research33

    Google Research 发布 MilleMiglia:用于中程物流的逼真实例生成器

    Google Research 推出 MilleMiglia,一个用 C++ 编写的实例生成器,可为中程(middle-mile)物流配送问题创建逼真的基准数据,源代码和文档已在 GitHub 上开源。中程物流负责区域或洲际尺度上配送中心之间的大宗货物运输,占总物流成本的相当大比例,但因数据敏感长期缺乏公开高质量数据。该工具将问题建模为时空图上的多商品流问题,可生成保护隐私的数据以支持后续研究。

9月16日周三
9月11日周五
9月8日周二
9月4日周五
  1. Google Research63

    Google Research 与 HHMI Janelia 发布完整雄性果蝇大脑连接组图谱

    Google Research 与 HHMI Janelia、MRC 分子生物学实验室及剑桥大学等合作,在 Cell 发表雄性果蝇大脑与中枢神经系统的完整连接组,包含超过 166,000 个神经元和 1.25 亿个突触连接,是目前按神经元数量计最大的大脑图谱。

    推荐理由:官方团队说明了这份连接组图谱的规模、验证方式和可视化工具,读者可以了解它与雌性图谱互补后的研究用途。

9月2日周三
8月28日周五
8月27日周四
  1. Google Research37

    GlucoFM:面向连续血糖监测的基础模型

    Google Research 推出 GlucoFM,一个自监督双流架构的连续血糖监测(CGM)基础模型,将缓慢血糖趋势与短期波动分开建模。该模型在 109,066 小时无标注 CGM 数据上预训练,在 4 个队列、7 项临床预测任务共 14 项评估中,平均 PR-AUC 比最强基线 GluFormer 高 5.8 个百分点,并在餐后血糖反应预测中取得最低 MAE。

8月26日周三
  1. Google Research39

    Google 发布 AgentHands:为 XR 空间对话生成同步手部手势的研究原型

    Google 在 CHI 2026 发表 AgentHands,一个让 XR 中 AI 智能体生成与语音同步的 3D 手部手势的研究原型。系统由环境感知、手势事件库、手势嵌入推理和同步 XR 执行四个模块组成,将 LLM 输出映射为精准的空间动作。在 12 人被试内实验中,与纯语音基线相比,该手势显著提升了空间指代与交互效果。

8月25日周二
8月21日周五
  1. Hugging Face Blog61

    Hugging Face 研究量化语音识别模型的基准优化行为

    Hugging Face 发布研究,提出三种测试量化 ASR 模型的基准优化(benchmaxxing)现象。评估 11 个开源模型发现,部分高分模型会复现 VoxPopuli 与 LibriSpeech 的错误参考文本、在音频中数字被静音时仍以约 30-40% 的比例输出该数字,并通过声学线索切换拼写以匹配基准期望;在模型训练截止后新采集的同源音频上,这些行为明显减弱。

    推荐理由:研究用三种探针量化了语音识别中的基准优化行为,为选型者提供了超越公开基准 WER 的评估思路。

8月17日周一
8月13日周四
  1. Microsoft Research41

    Microsoft Research 推出 MindTopo 基准,测试多模态模型的拓扑推理能力

    Microsoft Research 发布 MindTopo 基准,评估多模态大语言模型对连续性、分离、顺序、封闭和绳结五类拓扑概念的理解,涵盖静态推理与交互规划两个层级。测试显示,专有与开源模型在静态识别上明显优于交互式规划任务,且均远低于人类水平,错误多出现在规划阶段丢失结构关系。图像与视频生成工具仅在单帧内偶尔有帮助,难以在多步操作中保持拓扑约束。

8月12日周三
8月10日周一
8月6日周四
  1. Google DeepMind79

    Google DeepMind 开源 WeatherNext 气旋预报模型,Nature 论文称精度提升相当于十年进展

    Google DeepMind 在 Nature 发表论文并开源 WeatherNext 2 和 WeatherNext Cyclones 模型,称其对气旋路径、强度和风结构的预报平均比现有模型多出约 24 小时提前量,相当于约十年气象学进展。

    推荐理由:官方同时放出 Nature 论文与模型权重,读者可按论文结果自行复用或验证这套气旋预报方法。

7月31日周五
7月29日周三
7月26日周日
  1. Berkeley AI Research49

    ABBEL:教 LLM 更新信念状态以实现高效长程交互

    Berkeley AI Research 提出 ABBEL 框架,将大语言模型在长程交互中的摘要形式化为自然语言信念状态,并通过信念评分监督其信息内容。在 CollabBench 协作编程环境中,基于重构的信念评分使 ABBEL-rec-BG 将与全上下文模型的性能差距缩小约 50%,训练步数从 100 减至 50,且峰值上下文 token 长度仍显著低于全上下文设置。

7月23日周四
  1. Google Research66

    Google Research 发布 SymptomAI 研究论文,评估对话式 AI 症状评估的 réel 世界表现

    Google Research 发布 SymptomAI 研究,13,917 名参与者与五个 Gemini Flash 2.0 症状评估智能体对话进行鉴别诊断。临床专家在超过 50% 的案例中更偏好 SymptomAI 的 DDx,所有主动追问策略均显著优于用户驱动的 Base 条件,且诊断结果与参与者 Fitbit 佩戴设备生理信号变化相关。研究强调所有诊断仅供研究分析,不构成临床诊断。

    推荐理由:原文给出真实人群随机研究和临床对照结果,读者可了解对话式症状评估在非理想化场景下的实际表现。

7月16日周四
7月15日周三
  1. Hugging Face Blog51

    Hume 推出 Real World VoiceEQ 基准,衡量语音 AI 的人类级质量

    Hume 发布 Real World VoiceEQ 基准,基于超 100 万条人类评分,评估 40 多个专有与开源语音模型,覆盖 ASR、TTS、S2S 和语音理解的 15+ 维度、60+ 指标。评估发现 TTS 无一配置在八组能力中均进前五,语音模型听比说差,许多系统仍以转录文本为主而忽略语气、迟疑等副语言线索;部分模型疑似针对公开基准优化,SLM 自动评估仅适合明确任务,尚难替代人类听评。

7月9日周四
  1. Google Research65

    Google 发布 SensorFM:基于超一万亿分钟可穿戴数据的健康基础模型

    Google Research 发布大型传感器基础模型 SensorFM,在 500 万名同意参与者的超过一万亿分钟多模态可穿戴信号上自监督预训练。模型输入 PPG、加速度计、EDA、皮温和测高五类模态共 34 个一分钟聚合特征,采用 AIM 框架直接从不完整数据中学习。

    推荐理由:Google 自述其可穿戴基础模型的数据规模、AIM 缺失数据处理方法与下游结果,读者可了解可穿戴健康数据通用表示的可行路径。

7月8日周三
6月30日周二