跳到正文

全部动态

今日 7 条
8月21日周五
8月14日周五
8月12日周三
  1. Microsoft Research47

    微软研究院推出 CARE-X:面向临床实用放射影像 VLM 的辅助监督、奖励对齐学习与工具增强测量

    微软研究院发布研究模型 CARE-X,一个统一的胸部 X 光 VLM,结合生成式与判别式双推理,支持报告生成、疾病定位、多标签分类等多样临床解读任务。该模型采用 DAPO 强化学习在多任务设置中奖励临床正确性,并在 Narayana Health 的真实印度临床数据上验证。另一项独立实验将 Qwen3-VL-4B-Instruct 与确定性测量工具配对,评估直接计算能否提升测量依赖病灶的表现。

8月11日周二
  1. Hugging Face Blog60

    NVIDIA 发布 Magpie TTS Multilingual 开放权重模型,支持 12 种语言并降低语音生成延迟

    NVIDIA 发布 Magpie TTS Multilingual 开放权重模型,参数量 364M,新增现代标准阿拉伯语、韩语和巴西葡萄牙语,共支持 12 种语言,并提供生产级 NIM 部署容器。

    推荐理由:原文给出TTFA延迟数据和架构改进细节,读者可据此评估自部署级联语音方案相对一体化语音模型的取舍。

8月10日周一
8月4日周二
  1. Mistral AI62

    Mistral 发布开源多模态安全分类器 Shieldstral

    Mistral 发布 3B 开源权重多模态安全分类器 Shieldstral,将内容审核建模为策略自适应的问答任务,在推理时接受自然语言策略并输出校准的安全分数。该模型在文本安全上匹敌最大 7 倍于其体量的开放护栏模型,在多模态审核上创造新 SOTA,以 Apache 2.0 协议开放权重,可在单张 16GB GPU 上运行。

    推荐理由:原文给出把内容审核改写成策略自适应问答的建模思路和数据构建方法,对做安全分类器的团队有可迁移的参考价值。

7月28日周二
  1. Google DeepMind69

    Google DeepMind 发布 Gemini Robotics 2,实现机器人全身智能控制

    Google DeepMind 发布 Gemini Robotics 2 系列机器人模型,包含 VLA 模型 Gemini Robotics 2、具身推理模型 Gemini Robotics ER 2 和端侧模型 Gemini Robotics On-Device 2。

    推荐理由:官方一次性放出 VLA、具身推理和端侧三个机器人模型,读者可以借此了解全身控制、灵巧操作与多机协作的具体进展。

7月27日周一
7月21日周二
7月17日周五
7月16日周四
  1. Hugging Face Blog30

    DharmaOCR 如何以领域专精持续领先新发布的 Mistral OCR4 与 Unlimited-OCR

    DharmaOCR 在巴西葡萄牙语 OCR 基准上以 0.925 的得分领先新模型 Mistral OCR4(0.798)和 Unlimited-OCR(0.7587),证明领域专精的优势依然成立。该模型先通过葡萄牙语文档监督微调对齐词汇与文档结构,再用 DPO 从偏好数据中学习以降低输出退化率和推理成本。专项化训练使全部参数集中于单一语言,这一结构性取舍构成了对多语言模型的可量化优势。

7月8日周三
7月6日周一
7月2日周四
  1. Mistral AI65

    Mistral 发布 Leanstral 1.5:6B 激活参数的形式化证明模型

    Mistral 发布 Apache-2.0 开源的 Leanstral 1.5,总参数 119B、激活 6B,专攻 Lean 4 形式化证明。模型饱和 miniF2F,解出 PutnamBench 587/672 题,在 FATE-H 87%、FATE-X 34% 达到新 SOTA,成本约每题 $4。

    推荐理由:官方给出了完整训练流程、基准数字和开源获取方式,读者可以据此评估它在 Lean 4 形式化证明上的实际可用性。

7月1日周三
6月30日周二
6月11日周四
  1. Google DeepMind74

    Google DeepMind 发布开源实验模型 DiffusionGemma,GPU 文本生成最快提速 4 倍

    Google DeepMind 发布开源实验模型 DiffusionGemma,采用 26B 总参数、3.8B 激活的 MoE 扩散架构,在专用 GPU 上文本生成最高提速 4 倍,单块 NVIDIA H100 超过 1000 tokens/s,RTX 5090 超过 700 tokens/s。

    推荐理由:官方给出扩散文本生成的速度数据、显存占用与质量取舍,适合评估本地交互场景的落地条件。

6月9日周二
  1. Google DeepMind75

    Google DeepMind 发布 Gemma 4 12B:无编码器统一多模态模型

    Google DeepMind 发布 Gemma 4 12B,可在 16GB 内存或显存的笔记本本地运行,性能接近其 26B MoE 模型但内存占用不足一半。该模型采用无编码器统一架构,视觉与音频输入直接进入 LLM 主干,是首个支持原生音频输入的中等规模 Gemma 模型,以 Apache 2.0 许可发布,并同步推出官方 Skills 仓库。

    推荐理由:原文来自官方发布,给出架构细节、内存门槛和下载入口,可帮助读者评估在本地设备运行多模态模型的可行性。

5月27日周三
  1. Mistral AI48

    Mistral 收购 Emmi AI,推出面向工程加速的 physics AI 基础能力

    Mistral 将 Emmi AI 收入麾下,为企业级 AI 原生工业工程构建 physics AI 基础能力。这类数据驱动模型可从几何与边界条件直接预测物理行为,单 GPU 上一次前向传播数秒内输出完整物理场,替代传统 CFD/FEM 求解需数小时至数周的流程。已合作 ASML、Airbus、Safran、Siemens Energy 等伙伴,应用于产品设计、工装工艺设计和实时数字孪生。

5月22日周五
  1. Mistral AI74

    Mistral 发布 Mistral Medium 3.5 并推出 Vibe 云端远程智能体和 Le Chat Work 模式

    Mistral 发布 128B 开源权重旗舰模型 Mistral Medium 3.5(256k 上下文窗口,SWE-Bench Verified 77.6%),在 Hugging Face 以修改版 MIT 许可发布,API 定价为每百万输入 token $1.5、输出 $7.5。

    推荐理由:官方披露了新模型的参数量、上下文窗口和基准成绩,以及云端异步编码智能体的具体工作方式。

5月18日周一
  1. Google DeepMind81

    Google DeepMind 发布 Gemini Omni Flash 多模态视频生成模型

    Google DeepMind 发布 Gemini Omni 系列首个模型 Gemini Omni Flash,可结合图像、音频、视频和文本输入生成高质量视频,并支持通过自然语言多轮编辑。

    推荐理由:官方公告说明了 Gemini Omni Flash 的视频生成与对话式编辑能力、可用入口和订阅范围,读者可据此判断它如何改变创作流程。

5月16日周六
4月13日周一
4月3日周五
3月17日周二
  1. Mistral AI67

    Mistral 发布 Mistral Small 4,统一推理、多模态与编码能力并以 Apache 2.0 开源

    Mistral 发布 Mistral Small 4,是首个将 Magistral 推理、Pixtral 多模态和 Devstral 智能体编码能力统一到单一模型的小型旗舰,采用 Apache 2.0 许可开源。

    推荐理由:原文给出架构参数、reasoning_effort 用法和与 GPT-OSS 120B 的输出效率对比,读者可据此评估部署成本与选型。

2月5日周四
12月9日周二
  1. Mistral AI69

    Mistral 发布 Devstral 2(123B)与 Devstral Small 2(24B)开源编码模型及 Mistral Vibe CLI

    Mistral 发布开源编码模型 Devstral 2(123B,修改版 MIT 协议)与 Devstral Small 2(24B,Apache 2.0),SWE-bench Verified 分别为 72.2% 和 68.0%,支持 256K 上下文窗口。

    推荐理由:官方发布给出 SWE-bench Verified 分数、API 定价和部署门槛,可据此评估这款开源编码模型的实际性价比。

12月3日周三
7月30日周三
7月15日周二
7月11日周五
6月10日周二
5月28日周三
5月21日周三