跳到正文

#部署/工程

今日 4 条
9月10日周四
  1. Hugging Face Blog60

    Hugging Face 用 Storage Bucket 和代理实现跨 Jobs 的 Async GRPO LoRA 训练,无需 NCCL

    Hugging Face 在 TRL v1.14 的 AsyncGRPOTrainer 中加入 LoRA 支持(PR #7017),训练器与 vLLM 副本作为独立 HF Jobs 运行,仅几 MB 的 adapter 经 Storage Bucket 挂载同步,无需 NCCL。

    推荐理由:原文给出完整的跨节点 LoRA 异步 RL 架构与五轮瓶颈调优数据,读者可以复用其中按 KV 前缀路由和 token 打包的调优方法。

9月3日周四
9月1日周二
  1. Hugging Face Blog62

    Hugging Face 发布 @huggingface/kernels 与 207 个 WebGPU 内核

    Hugging Face WebAI 团队发布 @huggingface/kernels 库及 207 个 WebGPU 内核,每个内核以带版本、正确性与基准测试的独立仓库形式发布在 Hub 上,采用 Apache-2.0 许可。

    推荐理由:官方发布 207 个 WebGPU 内核及加载库,并给出与 ORT WebGPU 的实测对比,读者可据此评估浏览器推理的加速空间。

8月25日周二
8月21日周五
  1. Hugging Face Blog60

    Liquid AI 为 LFM2.5 系列发布 DSpark 草稿模型,推理最高提速 3.18x

    Liquid AI 为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 三个模型发布 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下提升解码速度。

    推荐理由:原文给出三类模型的加速数字、质量不变的原理和 llama.cpp、SGLang 的接入命令,读者可据此评估端侧与 GPU 推理收益。

8月20日周四
  1. Mistral AI67

    Mistral 发布 Agentic Search,多步检索循环显著提升复杂文档问答精度

    Mistral 发布 Agentic Search 检索层,通过 search、open、navigate、read、grep 五个工具实现多步检索循环,让模型在长文档和多数据源中查找、验证信息。

    推荐理由:原文给出 FinanceBench 与 OfficeQA Pro 的具体精度、延迟和 token 数据,读者可据此评估检索方案是否迁移到自家场景。

8月18日周二
  1. Hugging Face Blog52

    Dharma AI 发布约束感知 GPU 调度器:同集群利用率最高提升 33 个百分点

    Dharma AI 在 Hugging Face Blog 发布约束感知 GPU 分配器,与 FIFO 调度器在 7 个基准场景对比,GPU 利用率最高提升 33 个百分点,优先级加权产出平均提升 52%。该调度器将实时推理视为需求曲线而非峰值预留,批任务按优先级在 24 小时视野内规划,每次决策仅 1 至 15 毫秒,每个时间步只提交当前分配并每 30 至 60 分钟重跑以吸收预测误差。

8月11日周二
  1. Hugging Face Blog60

    NVIDIA 发布 Magpie TTS Multilingual 开放权重模型,支持 12 种语言并降低语音生成延迟

    NVIDIA 发布 Magpie TTS Multilingual 开放权重模型,参数量 364M,新增现代标准阿拉伯语、韩语和巴西葡萄牙语,共支持 12 种语言,并提供生产级 NIM 部署容器。

    推荐理由:原文给出TTFA延迟数据和架构改进细节,读者可据此评估自部署级联语音方案相对一体化语音模型的取舍。

8月6日周四
7月31日周五
  1. Microsoft Research62

    Microsoft Research 发布 Echoverse 计算机使用 Agent 训练环境并开源四个世界

    Microsoft Research 推出 Echoverse,为计算机使用 Agent 构建了 12 个深度训练环境,包括 10 个领域世界和 2 个能力世界(日期选择器与嵌套过滤)。

    推荐理由:原文给出深度世界优于浅层世界的实验对比和开源入口,读者可以据此判断合成训练环境如何影响 Agent 训练。

7月30日周四
7月29日周三
7月23日周四
  1. Hugging Face Blog68

    Hugging Face 将 Nunchaku 4-bit 扩散推理原生集成进 Diffusers

    Hugging Face 在 Diffusers 中新增 Nunchaku Lite 集成路径,可像普通 Diffusers 模型一样用 from_pretrained() 加载 Nunchaku SVDQuant 4-bit(W4A4)检查点,无需单独推理引擎或本地 CUDA 编译。

    推荐理由:官方宣布 Diffusers 原生支持 Nunchaku 4-bit 推理,附实测数据和自己量化新架构的完整工作流。

7月21日周二
7月16日周四
  1. Hugging Face Blog85

    Hugging Face 披露由自主 AI 智能体驱动的入侵事件及应对

    Hugging Face 披露本周检测并处置了一起由自主 AI 智能体系统端到端驱动的入侵,攻击者通过恶意数据集利用两条代码执行路径获得处理节点访问权限,窃取了部分内部数据集和多项服务凭证。

    推荐理由:披露一起由自主智能体发起的入侵及 AI 取证应对细节,读者可以了解防御侧如何在护栏限制下自建可用模型能力。

7月10日周五
7月9日周四
  1. Mistral AI43

    Mistral Studio 为 Prompts 和 Skills 提供系统记录

    Mistral 推出 Studio,为企业 Prompts 和 Skills 提供统一的系统记录,实现版本化、明确归属和可追溯。每个资产拥有不可变版本、回滚、标签分类和审计日志,业务人员可即时迭代并经审批和 CI/CD 推送到生产。技能可作为 MCP servers 直接调用,结合 Observability 将生产输出追溯到对应版本;该功能现已面向 Mistral Studio 客户开放。

7月8日周三
7月7日周二
  1. Hugging Face Blog64

    Hugging Face 与 SkyPilot 推出 store: hf,实现跨云零出口费挂载 Hub 存储

    Hugging Face 与 SkyPilot 联合推出 store: hf 后端,用 hf:// URL 将 Hugging Face Bucket 或任意 Hub 仓库挂载进 SkyPilot 任务,可在 20+ 云、Kubernetes 和 Slurm 上调度,读取数据零出口费。

    推荐理由:原文给出无出口费存储接入 SkyPilot 的具体用法、基准数字和成本对比,读者可据此评估跨云 GPU 训练的存储方案。

7月6日周一
7月1日周三
6月25日周四
  1. Google Research46

    Google 研究提出线性弹性缓存:用“滑雪租赁”问题优化云端缓存成本

    Google Research 在 CIDR 发表线性弹性缓存方法,把页面逐出建模为“滑雪租赁”问题,用轻量级机器学习动态调整缓存大小,以最小化缓存管理总拥有成本(TCO)。该方法已在 Spanner 生产服务器上集成数月,相比固定大小缓存,内存占用降低 15.5%,cache miss 仅增加 5.5%,TCO 约降 5%,实际 I/O 成本影响仅 0.5%。

6月24日周三
6月23日周二
5月28日周四
  1. Mistral AI48

    Mistral 在 AI Now Summit 2026 发布工业工程 AI 栈、统一智能体 Vibe 与 Les Ulis 数据中心

    Mistral 在 AI Now Summit 2026 发布面向工业工程的 AI 栈,并与 Airbus、BMW、ASML 合作优化设计、仿真与生产。其统一智能体 Vibe 可处理长周期多步任务,覆盖深度研究、日常流程编排和从需求到合并的编码工作。Les Ulis 10 MW 数据中心将专注推理,计划 2026 年 Q3 开放,以加强对算力的直接控制。

  2. Google Research48

    Google Research 通过零信任聚合实现隐私分析

    Google Research 推出面向隐私分析服务的高效密码学聚合新方案,遵循零信任原则,结合新型密码学协议与 TEE 硬件防护。该协议支持设备以单条一次性消息安全提交数据,无需多轮交互保持在线;密码学层可证明保证 Google 只能获得匿名化聚合结果,TEE attestation 则向所有参与者提供协议按公开代码正确执行的可验证证明。

5月22日周五
4月27日周一
4月22日周三
3月25日周三
3月18日周三
1月28日周三