Liquid AI 为 LFM2.5 系列发布 DSpark 草稿模型,推理最高提速 3.18x
Liquid AI 为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 三个模型发布 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下提升解码速度。
推荐理由:原文给出三类模型的加速数字、质量不变的原理和 llama.cpp、SGLang 的接入命令,读者可据此评估端侧与 GPU 推理收益。
Liquid AI 为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 三个模型发布 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下提升解码速度。
推荐理由:原文给出三类模型的加速数字、质量不变的原理和 llama.cpp、SGLang 的接入命令,读者可据此评估端侧与 GPU 推理收益。
Google DeepMind 发布 Gemma 4 12B,可在 16GB 内存或显存的笔记本本地运行,性能接近其 26B MoE 模型但内存占用不足一半。该模型采用无编码器统一架构,视觉与音频输入直接进入 LLM 主干,是首个支持原生音频输入的中等规模 Gemma 模型,以 Apache 2.0 许可发布,并同步推出官方 Skills 仓库。
推荐理由:原文来自官方发布,给出架构细节、内存门槛和下载入口,可帮助读者评估在本地设备运行多模态模型的可行性。
Mistral 发布新一代模型系列 Mistral 3,包含 Mistral Large 3(41B 激活、675B 总参数的 MoE)以及 3B、8B、14B 三档 Ministral 3 模型,全部以 Apache 2.0 许可开源。
推荐理由:官方一次放出 675B MoE 旗舰与三档小模型,全部 Apache 2.0 开源并给出部署路径,适合评估开源选型空间。