Hugging Face 让 vLLM 的 transformers 后端达到原生实现速度
Hugging Face 宣布 vLLM 的 transformers 建模后端在多个 LLM 架构上已达到甚至超过 vLLM 手写原生实现的推理速度。
推荐理由:官方给出三组 Qwen3 对比基准和可复现脚本,读者可据此判断是否直接切换到 transformers 后端省去移植成本。
开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。
Hugging Face 宣布 vLLM 的 transformers 建模后端在多个 LLM 架构上已达到甚至超过 vLLM 手写原生实现的推理速度。
推荐理由:官方给出三组 Qwen3 对比基准和可复现脚本,读者可据此判断是否直接切换到 transformers 后端省去移植成本。
Hugging Face 发布 LeRobot v0.6.0,引入 VLA-JEPA、LingBot-VA、FastWAM 等世界模型策略,新增 GR00T N1.7、MolmoAct2、EO-1、Multitask DiT、EVO1 等 VLA,以及统一奖励模型 API(Robometer、TOPReward)。
推荐理由:官方发布说明完整列出世界模型策略、奖励模型、评测基准与部署工具的具体变化,读者可据此评估是否升级和如何用于自己的机器人训练流程。
Mistral 发布 Apache-2.0 开源的 Leanstral 1.5,总参数 119B、激活 6B,专攻 Lean 4 形式化证明。模型饱和 miniF2F,解出 PutnamBench 587/672 题,在 FATE-H 87%、FATE-X 34% 达到新 SOTA,成本约每题 $4。
推荐理由:官方给出了完整训练流程、基准数字和开源获取方式,读者可以据此评估它在 Lean 4 形式化证明上的实际可用性。
Hugging Face 与 Cerebras 发布一个模块化、开源的实时语音对话(speech-to-speech)流水线,用 Cerebras 的高速推理解决语言模型响应延迟瓶颈。
推荐理由:原文给出了完整开放的级联语音对话架构和各层组件,开发者可以照此搭建或替换自己的实时语音 AI 流水线。
Google DeepMind 发布开源实验模型 DiffusionGemma,采用 26B 总参数、3.8B 激活的 MoE 扩散架构,在专用 GPU 上文本生成最高提速 4 倍,单块 NVIDIA H100 超过 1000 tokens/s,RTX 5090 超过 700 tokens/s。
推荐理由:官方给出扩散文本生成的速度数据、显存占用与质量取舍,适合评估本地交互场景的落地条件。
Google DeepMind 发布 Gemma 4 12B,可在 16GB 内存或显存的笔记本本地运行,性能接近其 26B MoE 模型但内存占用不足一半。该模型采用无编码器统一架构,视觉与音频输入直接进入 LLM 主干,是首个支持原生音频输入的中等规模 Gemma 模型,以 Apache 2.0 许可发布,并同步推出官方 Skills 仓库。
推荐理由:原文来自官方发布,给出架构细节、内存门槛和下载入口,可帮助读者评估在本地设备运行多模态模型的可行性。
Mistral 发布 128B 开源权重旗舰模型 Mistral Medium 3.5(256k 上下文窗口,SWE-Bench Verified 77.6%),在 Hugging Face 以修改版 MIT 许可发布,API 定价为每百万输入 token $1.5、输出 $7.5。
推荐理由:官方披露了新模型的参数量、上下文窗口和基准成绩,以及云端异步编码智能体的具体工作方式。
Google DeepMind 发布 Gemma 4 开源模型,称其为迄今最智能的开放模型,采用 Apache 2.0 许可,提供 E2B、E4B、26B MoE 和 31B Dense 四种尺寸。
推荐理由:官方发布给出四个尺寸、榜单名次、上下文长度与部署路径等具体信息,读者可据此评估选型和端侧部署方案。
Mistral 发布 Mistral Small 4,是首个将 Magistral 推理、Pixtral 多模态和 Devstral 智能体编码能力统一到单一模型的小型旗舰,采用 Apache 2.0 许可开源。
推荐理由:原文给出架构参数、reasoning_effort 用法和与 GPT-OSS 120B 的输出效率对比,读者可据此评估部署成本与选型。
Mistral 基于其开源编程助手 Vibe 构建了一个自主智能体,可读取 Rails 源文件、生成或改进 RSpec 测试,并通过 RuboCop 和 SimpleCov 工具在 CI/CD 流水线中无人工干预地并行运行。
推荐理由:原文给出可复用的 AGENTS.md、分文件类型 skills 和强制执行测试的做法,以及质量分从 0.49 升到 0.74 的实验数据。
Mistral 发布 Voxtral Transcribe 2,包含 Voxtral Mini Transcribe V2 批量转写模型和 Voxtral Realtime 实时模型。
推荐理由:官方给出两款语音转写模型的延迟、价格、词错率与开源权重信息,读者可据此评估语音转写方案选型。
Mistral 发布开源编码模型 Devstral 2(123B,修改版 MIT 协议)与 Devstral Small 2(24B,Apache 2.0),SWE-bench Verified 分别为 72.2% 和 68.0%,支持 256K 上下文窗口。
推荐理由:官方发布给出 SWE-bench Verified 分数、API 定价和部署门槛,可据此评估这款开源编码模型的实际性价比。
Mistral 发布新一代模型系列 Mistral 3,包含 Mistral Large 3(41B 激活、675B 总参数的 MoE)以及 3B、8B、14B 三档 Ministral 3 模型,全部以 Apache 2.0 许可开源。
推荐理由:官方一次放出 675B MoE 旗舰与三档小模型,全部 Apache 2.0 开源并给出部署路径,适合评估开源选型空间。
Mistral AI 宣布完成 17 亿欧元 Series C 融资,投后估值 117 亿欧元,由 ASML 领投并建立战略合作伙伴关系。
推荐理由:Mistral AI 官方宣布 Series C 融资细节,读者可了解估值规模与 ASML 战略合作的具体方向。
Mistral 发布 Voxtral 语音理解模型,提供 24B 生产级和 3B 本地/端侧两个版本,均以 Apache 2.0 许可开源,并可通过 API 调用,价格低至 $0.001 每分钟。
推荐理由:官方发布给出了两个规格、许可、价格和基准结果,读者可以据此评估它在语音理解场景替代现有方案的可行性。
Mistral AI 发布首个推理模型 Magistral,分为 24B 参数开源的 Magistral Small 和企业版 Magistral Medium。
推荐理由:官方公布两个版本的关键评测分数和开源许可,读者可以据此对比其在推理模型中的定位与可用部署方式。
Mistral AI 与 All Hands AI 合作发布面向软件工程任务的智能体模型 Devstral,以 Apache 2.0 许可开源。
推荐理由:官方给出了 SWE-Bench Verified 成绩、部署门槛和 API 定价,开源编码模型选型可据此对比。