跳到正文

#多模态

今日 1 条
今天9月30日周三
9月29日周二
9月28日周一
9月26日周六
9月25日周五
9月24日周四
  1. Hugging Face Blog60

    Liquid AI 发布 LFM2.5-VL-3B-DSpark 草稿模型,视觉语言模型解码提速最高 3.13x

    Liquid AI 为视觉语言模型 LFM2.5-VL-3B 发布实验性 DSpark 草稿模型,通过投机解码在不改变输出质量的前提下加速推理。解码最高提速 3.13x(M5 Max 端侧)和 2.66x(H100),端到端最高提升 2.62x 和 2.27x;草稿模型增加 280M 参数(约 8.9%),首日支持 llama.cpp、MLX-VLM 和 SGLang。

    推荐理由:原文给出视觉语言模型投机解码加速的具体数字、内存开销和第一天框架支持,读者可以据此评估端侧与 GPU 部署收益。

9月23日周三
9月21日周一
9月18日周五
9月16日周三
9月4日周五
  1. Google Research63

    Google Research 与 HHMI Janelia 发布完整雄性果蝇大脑连接组图谱

    Google Research 与 HHMI Janelia、MRC 分子生物学实验室及剑桥大学等合作,在 Cell 发表雄性果蝇大脑与中枢神经系统的完整连接组,包含超过 166,000 个神经元和 1.25 亿个突触连接,是目前按神经元数量计最大的大脑图谱。

    推荐理由:官方团队说明了这份连接组图谱的规模、验证方式和可视化工具,读者可以了解它与雌性图谱互补后的研究用途。

9月3日周四
9月2日周三
  1. Google DeepMind73

    Google DeepMind 为 Gemini 推出 agentic video understanding,token 消耗最高降 88%

    Google DeepMind 发布 agentic video understanding 功能,覆盖 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite,通过智能体循环动态搜索和检视视频片段,替代固定帧率的静态处理。

    推荐理由:官方公布了具体降本增效数字和 API 启用方式,开发者可据此评估长视频分析的成本与精度取舍。

9月1日周二
8月28日周五
8月27日周四
8月26日周三
  1. Google Research39

    Google 发布 AgentHands:为 XR 空间对话生成同步手部手势的研究原型

    Google 在 CHI 2026 发表 AgentHands,一个让 XR 中 AI 智能体生成与语音同步的 3D 手部手势的研究原型。系统由环境感知、手势事件库、手势嵌入推理和同步 XR 执行四个模块组成,将 LLM 输出映射为精准的空间动作。在 12 人被试内实验中,与纯语音基线相比,该手势显著提升了空间指代与交互效果。

8月21日周五
8月17日周一
8月13日周四
  1. Microsoft Research41

    Microsoft Research 推出 MindTopo 基准,测试多模态模型的拓扑推理能力

    Microsoft Research 发布 MindTopo 基准,评估多模态大语言模型对连续性、分离、顺序、封闭和绳结五类拓扑概念的理解,涵盖静态推理与交互规划两个层级。测试显示,专有与开源模型在静态识别上明显优于交互式规划任务,且均远低于人类水平,错误多出现在规划阶段丢失结构关系。图像与视频生成工具仅在单帧内偶尔有帮助,难以在多步操作中保持拓扑约束。

8月12日周三
  1. Microsoft Research47

    微软研究院推出 CARE-X:面向临床实用放射影像 VLM 的辅助监督、奖励对齐学习与工具增强测量

    微软研究院发布研究模型 CARE-X,一个统一的胸部 X 光 VLM,结合生成式与判别式双推理,支持报告生成、疾病定位、多标签分类等多样临床解读任务。该模型采用 DAPO 强化学习在多任务设置中奖励临床正确性,并在 Narayana Health 的真实印度临床数据上验证。另一项独立实验将 Qwen3-VL-4B-Instruct 与确定性测量工具配对,评估直接计算能否提升测量依赖病灶的表现。

8月11日周二
  1. Hugging Face Blog60

    NVIDIA 发布 Magpie TTS Multilingual 开放权重模型,支持 12 种语言并降低语音生成延迟

    NVIDIA 发布 Magpie TTS Multilingual 开放权重模型,参数量 364M,新增现代标准阿拉伯语、韩语和巴西葡萄牙语,共支持 12 种语言,并提供生产级 NIM 部署容器。

    推荐理由:原文给出TTFA延迟数据和架构改进细节,读者可据此评估自部署级联语音方案相对一体化语音模型的取舍。

8月10日周一
8月4日周二
  1. Mistral AI62

    Mistral 发布开源多模态安全分类器 Shieldstral

    Mistral 发布 3B 开源权重多模态安全分类器 Shieldstral,将内容审核建模为策略自适应的问答任务,在推理时接受自然语言策略并输出校准的安全分数。该模型在文本安全上匹敌最大 7 倍于其体量的开放护栏模型,在多模态审核上创造新 SOTA,以 Apache 2.0 协议开放权重,可在单张 16GB GPU 上运行。

    推荐理由:原文给出把内容审核改写成策略自适应问答的建模思路和数据构建方法,对做安全分类器的团队有可迁移的参考价值。

7月30日周四
7月21日周二
7月16日周四
  1. Hugging Face Blog30

    DharmaOCR 如何以领域专精持续领先新发布的 Mistral OCR4 与 Unlimited-OCR

    DharmaOCR 在巴西葡萄牙语 OCR 基准上以 0.925 的得分领先新模型 Mistral OCR4(0.798)和 Unlimited-OCR(0.7587),证明领域专精的优势依然成立。该模型先通过葡萄牙语文档监督微调对齐词汇与文档结构,再用 DPO 从偏好数据中学习以降低输出退化率和推理成本。专项化训练使全部参数集中于单一语言,这一结构性取舍构成了对多语言模型的可量化优势。

7月15日周三
  1. Hugging Face Blog81

    Thinking Machines 发布开源多模态大模型 Inkling 及 Inkling-Small

    Thinking Machines 在 Hugging Face 发布开源多模态模型 Inkling,总计 975B 参数、激活 41B 的 MoE 架构,原生接受图像、文本和音频输入,支持 1M 上下文,训练数据为 45 万亿 token。

    推荐理由:原文给出 Inkling 与 Inkling-Small 的架构细节、部署配置和多份基准数字,可帮助读者评估其在多模态推理场景的可用性。

7月13日周一
7月6日周一
7月1日周三