Google 发布 TurboQuant:以极致压缩重新定义 AI 效率
Google 推出 TurboQuant 压缩算法(ICLR 2026),在零精度损失下大幅缩减模型体积,同时支持 KV cache 压缩和向量搜索。其核心依赖 QJL 的零开销 1-bit 技巧与 PolarQuant 的极坐标压缩,消除了传统向量量化每数字 1-2 bit 的内存开销。
Google 推出 TurboQuant 压缩算法(ICLR 2026),在零精度损失下大幅缩减模型体积,同时支持 KV cache 压缩和向量搜索。其核心依赖 QJL 的零开销 1-bit 技巧与 PolarQuant 的极坐标压缩,消除了传统向量量化每数字 1-2 bit 的内存开销。
Mistral 发布 Mistral Small 4,是首个将 Magistral 推理、Pixtral 多模态和 Devstral 智能体编码能力统一到单一模型的小型旗舰,采用 Apache 2.0 许可开源。
推荐理由:原文给出架构参数、reasoning_effort 用法和与 GPT-OSS 120B 的输出效率对比,读者可据此评估部署成本与选型。
Google Research 与 Cornell 合作在 PNAS 发表论文,让 GPT-4o、Perplexity、Claude 3.5、Gemini Advanced Pro 1.5、NotebookLM 和自建 RAG 系统回答 67 个铜氧化物高温超导专家问题,由专家按 0 到 2 分多指标盲评。
Mistral 发布新一代模型系列 Mistral 3,包含 Mistral Large 3(41B 激活、675B 总参数的 MoE)以及 3B、8B、14B 三档 Ministral 3 模型,全部以 Apache 2.0 许可开源。
推荐理由:官方一次放出 675B MoE 旗舰与三档小模型,全部 Apache 2.0 开源并给出部署路径,适合评估开源选型空间。
Berkeley AI Research 介绍了一种基于“分而治之”的 off-policy RL 价值学习算法,替代 TD learning。传统 TD learning 的 Bellman 递归会使误差随长 horizon 累积,TD-n 只能按常数因子减少递归次数,而分而治之可将递归次数按对数级降低,且无需调超参数 n。
Berkeley AI Research 的新论文为 word2vec 的学习过程提供了定量预测理论:证明在若干温和近似条件下,其学习问题可归约为无加权最小二乘矩阵分解,梯度流动力学可解析求解,最终学到的表示等价于对特定目标矩阵 $M^\star$ 做 PCA。
Mistral AI 为 Le Chat 推出一批新功能,包括 Deep Research(预览)研究模式、基于 Voxtral 模型的语音模式、由 Magistral 推理模型驱动的多语言思考模式、Projects 项目文件夹,以及与 Black Forest Labs 合作的图像编辑。
Mistral AI 发布首个推理模型 Magistral,分为 24B 参数开源的 Magistral Small 和企业版 Magistral Medium。
推荐理由:官方公布两个版本的关键评测分数和开源许可,读者可以据此对比其在推理模型中的定位与可用部署方式。