LLaMA 剪枝的物理学视角:把 Transformer block 删除转化为 Ising 优化问题
Multiverse 的最新论文将 LLM 深度剪枝中的 block 选择问题重构为约束二元优化(CBO),直接映射到 Ising glass 自旋系统,能量值成为剪枝后模型 benchmark 表现的廉价代理指标。
Multiverse 的最新论文将 LLM 深度剪枝中的 block 选择问题重构为约束二元优化(CBO),直接映射到 Ising glass 自旋系统,能量值成为剪枝后模型 benchmark 表现的廉价代理指标。
GitHub 用 AI 智能体将 Copilot 智能体运行时完整重写为超过 800,000 行生产 Rust,通过 128 个 pull request 增量合入 main 并逐步发布,于 2026 年 8 月 21 日达成 100% Rust。
推荐理由:作者亲历复盘用 AI 智能体将 Copilot 运行时从 TypeScript 迁移到 80 万行 Rust 的过程,给出可迁移的增量迁移、提示词缓存与多会话协作方法。
NVIDIA Vera Rubin NVL72 首次提交 MLPerf Inference v6.1 预览成绩,在 Qwen3-VL 上吞吐最高达 GB300 NVL72 的 3.7x,在 DeepSeek-R1 上达 2.5x,使用 vLLM、Dynamo 和 TensorRT-LLM。
Emerald AI、Google 与 NVIDIA 宣布成立 AI Energy Management Alliance(AEMA),推动数据中心根据电网状况动态调整用电。
曼彻斯特大学与 NVIDIA 合作,将 Earth-2 CorrDiff 生成式降尺度模型用于全英空气污染预测,在英国国家 AI 超算 Isambard-AI 上用一年逐小时污染数据训练,仅 2 天即在单个 8-GPU 节点上完成,生成 2-3 平方公里分辨率的全英污染模型。
NVIDIA 介绍 DSX 平台在 AI 工厂电力管理上的进展。Lambda 在 HGX B200 五机架 19 节点集群上验证 DSX MaxLPS,同样电力预算下集群 token 吞吐从约 400 万每秒提升到 500 万每秒。
OpenAI 将 Habitat 从一个 Python 库演进为全球分布式存储平台,服务超过 10 亿 ChatGPT 用户,支撑每秒 2200 万次请求。
Mistral 与 Cloudera 宣布合作,将 Mistral 模型集成到 Cloudera 混合数据平台,企业可在私有云、公有云、本地乃至完全物理隔离环境中运行推理,并可基于自有数据在受控环境训练定制模型,保留数据与模型的所有权。合作旨在满足主权 AI 需求,覆盖 Cloudera 平台上 30 exabytes 的客户管理数据。
Hugging Face 在 TRL v1.14 的 AsyncGRPOTrainer 中加入 LoRA 支持(PR #7017),训练器与 vLLM 副本作为独立 HF Jobs 运行,仅几 MB 的 adapter 经 Storage Bucket 挂载同步,无需 NCCL。
推荐理由:原文给出完整的跨节点 LoRA 异步 RL 架构与五轮瓶颈调优数据,读者可以复用其中按 KV 前缀路由和 token 打包的调优方法。
Google 推出 Fairwind Program,向政府机构、Google Cloud 客户和网络安全合作伙伴提供先进网络防御能力。该计划将专用模型 Gemini 3.8 Flash Cyber 与 CodeMender 结合,可自主查找、验证并修复漏洞,在几分钟内生成可直接部署的补丁,运营成本远低于传统前沿模型。
Hugging Face WebAI 团队发布 @huggingface/kernels 库及 207 个 WebGPU 内核,每个内核以带版本、正确性与基准测试的独立仓库形式发布在 Hub 上,采用 Apache-2.0 许可。
推荐理由:官方发布 207 个 WebGPU 内核及加载库,并给出与 ORT WebGPU 的实测对比,读者可据此评估浏览器推理的加速空间。
Multiverse Computing 发布论文 Quantization-Aware Healing,提出 QAH 方法:直接从压缩前的原始模型蒸馏,修复经过结构压缩并量化到 MXFP4 的模型。
Hugging Face 在 Gradio 中推出 gr.Workflow,把 AI 应用流水线变成类型化节点图,每个节点可运行、中间结果可见。
推荐理由:官方详解了 gr.Workflow 的节点图结构和 REST API 用法,读者可以据此判断如何把多步骤 AI 流水线搭成可拖拽、可部署的应用。
Liquid AI 为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 三个模型发布 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下提升解码速度。
推荐理由:原文给出三类模型的加速数字、质量不变的原理和 llama.cpp、SGLang 的接入命令,读者可据此评估端侧与 GPU 推理收益。
Microsoft Research 发布深度学习 DFT 泛函 Skala 1.1,训练数据较前一版增加 2.5 倍,在 GMTKN55 基准的 55 个类别中 32 个排名第一,加权平均误差 2.8 kcal/mol,超过最昂贵的 global hybrid 泛函,同时保持 meta-GGA 级计算成本。
Mistral 发布 Agentic Search 检索层,通过 search、open、navigate、read、grep 五个工具实现多步检索循环,让模型在长文档和多数据源中查找、验证信息。
推荐理由:原文给出 FinanceBench 与 OfficeQA Pro 的具体精度、延迟和 token 数据,读者可据此评估检索方案是否迁移到自家场景。
Dharma AI 在 Hugging Face Blog 发布约束感知 GPU 分配器,与 FIFO 调度器在 7 个基准场景对比,GPU 利用率最高提升 33 个百分点,优先级加权产出平均提升 52%。该调度器将实时推理视为需求曲线而非峰值预留,批任务按优先级在 24 小时视野内规划,每次决策仅 1 至 15 毫秒,每个时间步只提交当前分配并每 30 至 60 分钟重跑以吸收预测误差。
Mistral 宣布三项主权 AI 举措:Mistral Regional Endpoints 正式可用,可选择推理在 Europe 或 US 运行;Mistral Priority Tier 公开预览,提供自定义速率限制和 uptime SLA。
NVIDIA 发布 Magpie TTS Multilingual 开放权重模型,参数量 364M,新增现代标准阿拉伯语、韩语和巴西葡萄牙语,共支持 12 种语言,并提供生产级 NIM 部署容器。
推荐理由:原文给出TTFA延迟数据和架构改进细节,读者可据此评估自部署级联语音方案相对一体化语音模型的取舍。
Baseten 正式成为 Hugging Face Hub 的 Inference Provider,为 Hub 上的 serverless 推理提供支持,首发支持对话与文本生成任务,涵盖 Kimi K3、DeepSeek V4 Flash、GLM-5.2 等开源权重 LLM。
Microsoft Research 推出 Echoverse,为计算机使用 Agent 构建了 12 个深度训练环境,包括 10 个领域世界和 2 个能力世界(日期选择器与嵌套过滤)。
推荐理由:原文给出深度世界优于浅层世界的实验对比和开源入口,读者可以据此判断合成训练环境如何影响 Agent 训练。
Hugging Face 提出企业 AI 的下一个真正约束是利用率而非智能,并以航空业类比:GPU 成本按日历小时累积(融资、折旧、电力、制冷),产出却只按计算小时累积。
IBM Research 与 UC Berkeley Sky Lab 基于 K-Search 进化式内核搜索框架构建 MLX 后端,通过结构化 CUDA 到 MLX 翻译层把既有 CUDA 内核知识转化为 Apple Silicon 的优化指引。
Hugging Face 在 Diffusers 中新增 Nunchaku Lite 集成路径,可像普通 Diffusers 模型一样用 from_pretrained() 加载 Nunchaku SVDQuant 4-bit(W4A4)检查点,无需单独推理引擎或本地 CUDA 编译。
推荐理由:官方宣布 Diffusers 原生支持 Nunchaku 4-bit 推理,附实测数据和自己量化新架构的完整工作流。
Hugging Face 旗下 Pollen Robotics 发布开源低成本系统 Grabette,用手持夹爪即可录制操作演示并自动生成机器人可用数据集,无需真实机器人或遥操作设备。
Hugging Face 披露本周检测并处置了一起由自主 AI 智能体系统端到端驱动的入侵,攻击者通过恶意数据集利用两条代码执行路径获得处理节点访问权限,窃取了部分内部数据集和多项服务凭证。
推荐理由:披露一起由自主智能体发起的入侵及 AI 取证应对细节,读者可以了解防御侧如何在护栏限制下自建可用模型能力。
IBM Research 团队结合在 Agent 系统中构建路由的实践,提出模型路由本质是系统优化而非分类问题。
Hugging Face 博客发布 Profiling in PyTorch 系列第三篇,用 profiler 分析注意力机制从朴素实现到 SDPA 各后端的表现。
推荐理由:文章用 profiler 逐一对注意力各实现读 trace,给出 kernel 数、耗时与占用率等一手数据,方法可直接迁移到自己的模型调优。
Mistral 推出 Studio,为企业 Prompts 和 Skills 提供统一的系统记录,实现版本化、明确归属和可追溯。每个资产拥有不可变版本、回滚、标签分类和审计日志,业务人员可即时迭代并经审批和 CI/CD 推送到生产。技能可作为 MCP servers 直接调用,结合 Observability 将生产输出追溯到对应版本;该功能现已面向 Mistral Studio 客户开放。
Hugging Face 宣布 vLLM 的 transformers 建模后端在多个 LLM 架构上已达到甚至超过 vLLM 手写原生实现的推理速度。
推荐理由:官方给出三组 Qwen3 对比基准和可复现脚本,读者可据此判断是否直接切换到 transformers 后端省去移植成本。
Hugging Face 与 Amazon SageMaker AI 推出深度链接集成,开发者在 Hugging Face 模型页点击 “Customize on SageMaker AI” 或 “Deploy on SageMaker AI”,即可一键进入 SageMaker Studio 的微调或端点部署工作流,模型已预加载。
Microsoft 在 Build 2026 上宣布 Hugging Face models on Foundry,一个每周更新的精选开放权重模型目录,可一键部署到 Foundry Managed Compute 托管 GPU 平台。
UC Berkeley 的 Aditya G. Parameswaran 等人撰文指出,GPT-4 级能力的推理成本已从 2023 年初的约 $30 per million tokens 降至 $1 以下,部分供应商甚至低于 $0.10,基准推理价格每年下降 9x 至 900x。
Hugging Face 与 SkyPilot 联合推出 store: hf 后端,用 hf:// URL 将 Hugging Face Bucket 或任意 Hub 仓库挂载进 SkyPilot 任务,可在 20+ 云、Kubernetes 和 Slurm 上调度,读取数据零出口费。
推荐理由:原文给出无出口费存储接入 SkyPilot 的具体用法、基准数字和成本对比,读者可据此评估跨云 GPU 训练的存储方案。
Hugging Face 发布 🤗 Kernels 项目重大更新,几乎重新设计了整个项目。Hub 新增 kernel 仓库类型;安全方面引入可信发布者机制(默认仅加载可信发布者的 kernel。
Hugging Face 与 Cerebras 发布一个模块化、开源的实时语音对话(speech-to-speech)流水线,用 Cerebras 的高速推理解决语言模型响应延迟瓶颈。
推荐理由:原文给出了完整开放的级联语音对话架构和各层组件,开发者可以照此搭建或替换自己的实时语音 AI 流水线。
Google Research 在 CIDR 发表线性弹性缓存方法,把页面逐出建模为“滑雪租赁”问题,用轻量级机器学习动态调整缓存大小,以最小化缓存管理总拥有成本(TCO)。该方法已在 Spanner 生产服务器上集成数月,相比固定大小缓存,内存占用降低 15.5%,cache miss 仅增加 5.5%,TCO 约降 5%,实际 I/O 成本影响仅 0.5%。
Mistral AI 推出 Connectors 多项新能力:管理员控制(GA)可按 workspace/org 设置连接器访问并开关单个工具,API key 支持连接器 scope,多账号连接器(GA)允许一个连接器绑定多个账号。
Mistral 发布 OCR 4 文档解析模型,在提取文本之外返回边界框、块类型分类和逐词逐页置信度分数,支持 170 种语言、10 个语言组。
推荐理由:官方发布给出了结构化输出能力、价格和基准局限说明,读者可据此评估它对 RAG 与文档流程的适配。
Mistral 在 AI Now Summit 2026 发布面向工业工程的 AI 栈,并与 Airbus、BMW、ASML 合作优化设计、仿真与生产。其统一智能体 Vibe 可处理长周期多步任务,覆盖深度研究、日常流程编排和从需求到合并的编码工作。Les Ulis 10 MW 数据中心将专注推理,计划 2026 年 Q3 开放,以加强对算力的直接控制。