跳到正文

全部动态

今日 11 条
8月28日周五
8月27日周四
  1. Google DeepMind54

    Google DeepMind 试点全球首个专有前沿模型双盲评估

    Google DeepMind 推出全球首个针对专有前沿 AI 模型的双盲评估,将外部评测限制在密码学安全的隔离环境中,防止模型提前接触测试题造成基准污染。Gemini Flash Lite 模型将与 Singapore AI Safety Institute、OpenMined、AVERI 和 MLCommons 合作,在隐私保护环境下测试机密基准。

  2. Google Research37

    GlucoFM:面向连续血糖监测的基础模型

    Google Research 推出 GlucoFM,一个自监督双流架构的连续血糖监测(CGM)基础模型,将缓慢血糖趋势与短期波动分开建模。该模型在 109,066 小时无标注 CGM 数据上预训练,在 4 个队列、7 项临床预测任务共 14 项评估中,平均 PR-AUC 比最强基线 GluFormer 高 5.8 个百分点,并在餐后血糖反应预测中取得最低 MAE。

8月26日周三
  1. Hugging Face Blog71

    Sentence Transformers v6.0 教程:训练与微调多向量嵌入模型

    Sentence Transformers v6.0 引入 MultiVectorEncoder 模型类型并配套完整训练流程,作者以医学检索为例演示如何微调 ColBERT 式多向量模型。

    推荐理由:原文给出完整可复现的多向量模型微调配方,并用实验数据对比起点选择、训练开销和索引压缩,方法可直接迁移到自己的领域数据。

  2. Google Research39

    Google 发布 AgentHands:为 XR 空间对话生成同步手部手势的研究原型

    Google 在 CHI 2026 发表 AgentHands,一个让 XR 中 AI 智能体生成与语音同步的 3D 手部手势的研究原型。系统由环境感知、手势事件库、手势嵌入推理和同步 XR 执行四个模块组成,将 LLM 输出映射为精准的空间动作。在 12 人被试内实验中,与纯语音基线相比,该手势显著提升了空间指代与交互效果。

8月25日周二
  1. Hugging Face Blog66

    IBM Granite 4.2 推理模型家族发布,3B/8B/30B 全系采用 Apache 2.0 开源

    IBM 发布 Granite 4.2 推理模型家族,包含 3B、8B、30B 三个 dense 尺寸,基于 Granite-4.1 基座(从头预训练约 15T tokens,五阶段策略将上下文窗口扩展至 512K tokens),经 CoT 与智能体轨迹数据的 SFT 后,再用异步 GRPO 多阶段 RL 流水线后训练。

    推荐理由:官方完整披露 Granite 4.2 的五阶段预训练、SFT 配比与多阶段 RL 课程设计,读者可以直接对照复现其训练路线。

  2. Mistral AI40

    Mistral 与 HUMAIN 达成战略合作,推进沙特及中东主权 AI

    Mistral 与 HUMAIN 宣布在 AI 基础设施、先进模型开发与解决方案部署上开展战略合作,规模达数亿欧元。双方将推进模型开发与本地化,初期聚焦网络安全和语音,并开发阿拉伯语表现优异的前沿模型。Mistral 将探索使用 HUMAIN 数据中心基础设施,双方还计划在沙特针对受监管行业制定联合市场策略。

8月22日周六
8月21日周五
  1. Hugging Face Blog61

    Hugging Face 研究量化语音识别模型的基准优化行为

    Hugging Face 发布研究,提出三种测试量化 ASR 模型的基准优化(benchmaxxing)现象。评估 11 个开源模型发现,部分高分模型会复现 VoxPopuli 与 LibriSpeech 的错误参考文本、在音频中数字被静音时仍以约 30-40% 的比例输出该数字,并通过声学线索切换拼写以匹配基准期望;在模型训练截止后新采集的同源音频上,这些行为明显减弱。

    推荐理由:研究用三种探针量化了语音识别中的基准优化行为,为选型者提供了超越公开基准 WER 的评估思路。

  2. Hugging Face Blog60

    Liquid AI 为 LFM2.5 系列发布 DSpark 草稿模型,推理最高提速 3.18x

    Liquid AI 为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 三个模型发布 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下提升解码速度。

    推荐理由:原文给出三类模型的加速数字、质量不变的原理和 llama.cpp、SGLang 的接入命令,读者可据此评估端侧与 GPU 推理收益。

8月20日周四
  1. Mistral AI67

    Mistral 发布 Agentic Search,多步检索循环显著提升复杂文档问答精度

    Mistral 发布 Agentic Search 检索层,通过 search、open、navigate、read、grep 五个工具实现多步检索循环,让模型在长文档和多数据源中查找、验证信息。

    推荐理由:原文给出 FinanceBench 与 OfficeQA Pro 的具体精度、延迟和 token 数据,读者可据此评估检索方案是否迁移到自家场景。

8月19日周三
8月18日周二
  1. Hugging Face Blog52

    Dharma AI 发布约束感知 GPU 调度器:同集群利用率最高提升 33 个百分点

    Dharma AI 在 Hugging Face Blog 发布约束感知 GPU 分配器,与 FIFO 调度器在 7 个基准场景对比,GPU 利用率最高提升 33 个百分点,优先级加权产出平均提升 52%。该调度器将实时推理视为需求曲线而非峰值预留,批任务按优先级在 24 小时视野内规划,每次决策仅 1 至 15 毫秒,每个时间步只提交当前分配并每 30 至 60 分钟重跑以吸收预测误差。

8月17日周一
8月14日周五
  1. Hugging Face Blog71

    Hugging Face 发布 2026 夏季开源模型生态观察报告

    Hugging Face 发布 2026 年 1 至 8 月开源模型生态观察报告:Hub 公开模型仓库从 243 万增至 296 万,中国实验室在多数月份发布的最大开源模型超过美国,Qwen 衍生模型达 151,448 个成为社区主要基座。

    推荐理由:Hugging Face 用七个月的 Hub 数据量化开源模型生态的变化,读者可以据此核对中美发布策略、下载与关注度的错位以及 Agent 流量的真实构成。

8月13日周四
  1. Hugging Face Blog76

    Hugging Face 复盘 ICML 2026 论文复现挑战赛:1,221 人复现 2,226 篇论文

    Hugging Face 复盘今年 7 月 15 日至 8 月 2 日举办的 ICML 2026 Open Reproductions 挑战赛:1,221 名社区成员用 Claude Code、Codex、Cursor 等智能体,19 天发布 6,816 份 Trackio 日志,尝试复现 2,226 篇论文,约占会议论文的 34%。

    推荐理由:文中给出按声明逐条复核会议论文的结果分布和典型的证伪案例,读者可以借此理解智能体复现研究中人类角色的边界。

  2. Microsoft Research41

    Microsoft Research 推出 MindTopo 基准,测试多模态模型的拓扑推理能力

    Microsoft Research 发布 MindTopo 基准,评估多模态大语言模型对连续性、分离、顺序、封闭和绳结五类拓扑概念的理解,涵盖静态推理与交互规划两个层级。测试显示,专有与开源模型在静态识别上明显优于交互式规划任务,且均远低于人类水平,错误多出现在规划阶段丢失结构关系。图像与视频生成工具仅在单帧内偶尔有帮助,难以在多步操作中保持拓扑约束。

8月12日周三
  1. Microsoft Research47

    微软研究院推出 CARE-X:面向临床实用放射影像 VLM 的辅助监督、奖励对齐学习与工具增强测量

    微软研究院发布研究模型 CARE-X,一个统一的胸部 X 光 VLM,结合生成式与判别式双推理,支持报告生成、疾病定位、多标签分类等多样临床解读任务。该模型采用 DAPO 强化学习在多任务设置中奖励临床正确性,并在 Narayana Health 的真实印度临床数据上验证。另一项独立实验将 Qwen3-VL-4B-Instruct 与确定性测量工具配对,评估直接计算能否提升测量依赖病灶的表现。

8月11日周二
  1. Hugging Face Blog60

    NVIDIA 发布 Magpie TTS Multilingual 开放权重模型,支持 12 种语言并降低语音生成延迟

    NVIDIA 发布 Magpie TTS Multilingual 开放权重模型,参数量 364M,新增现代标准阿拉伯语、韩语和巴西葡萄牙语,共支持 12 种语言,并提供生产级 NIM 部署容器。

    推荐理由:原文给出TTFA延迟数据和架构改进细节,读者可据此评估自部署级联语音方案相对一体化语音模型的取舍。

8月10日周一
8月6日周四
  1. Google DeepMind79

    Google DeepMind 开源 WeatherNext 气旋预报模型,Nature 论文称精度提升相当于十年进展

    Google DeepMind 在 Nature 发表论文并开源 WeatherNext 2 和 WeatherNext Cyclones 模型,称其对气旋路径、强度和风结构的预报平均比现有模型多出约 24 小时提前量,相当于约十年气象学进展。

    推荐理由:官方同时放出 Nature 论文与模型权重,读者可按论文结果自行复用或验证这套气旋预报方法。