跳到正文

#Agent

今日 4 条
9月11日周五
9月10日周四
  1. Hugging Face Blog60

    Hugging Face 用 Storage Bucket 和代理实现跨 Jobs 的 Async GRPO LoRA 训练,无需 NCCL

    Hugging Face 在 TRL v1.14 的 AsyncGRPOTrainer 中加入 LoRA 支持(PR #7017),训练器与 vLLM 副本作为独立 HF Jobs 运行,仅几 MB 的 adapter 经 Storage Bucket 挂载同步,无需 NCCL。

    推荐理由:原文给出完整的跨节点 LoRA 异步 RL 架构与五轮瓶颈调优数据,读者可以复用其中按 KV 前缀路由和 token 打包的调优方法。

9月9日周三
  1. Mistral AI61

    Mistral 复盘用 AI 智能体迁移 4 万行 Fortran 77 遗留代码到 C++ 的实践

    Mistral 帮助一家欧洲能源运营商将 4 万行 Fortran 77 储层模拟器代码迁移到 C++,先搭建数值对齐校验环境并用百余个智能体生成文档。实践发现结构化工作流加人工审查优于完全自主,首个冲刺完成 300,000 行中的 40,000 行核心功能,并总结出先建对齐环境、先整理文档、采用带人工审查门的结构化工作流三条原则。

    推荐理由:Mistral 复盘真实迁移案例并给出可复用的三条原则,读者可以对照自己的遗留系统改造工作流。

9月6日周日
9月5日周六
  1. GitHub Blog · AI & ML68

    GitHub 发布 Project HydraFusion 研究预览,用多模型运行时编排提供前沿级编码质量

    GitHub 推出 Project HydraFusion 研究预览,通过运行时多模型编排为每个任务生成执行计划,在 Single、Cascade、Critique 三种模式间选择以平衡质量、成本和延迟。

    推荐理由:官方公布了 HydraFusion 的三种执行模式和三份基准的质量与成本数据,读者可以据此评估多模型编排对编码工作流的实际价值。

9月4日周五
9月3日周四
8月28日周五
8月26日周三
  1. Google Research39

    Google 发布 AgentHands:为 XR 空间对话生成同步手部手势的研究原型

    Google 在 CHI 2026 发表 AgentHands,一个让 XR 中 AI 智能体生成与语音同步的 3D 手部手势的研究原型。系统由环境感知、手势事件库、手势嵌入推理和同步 XR 执行四个模块组成,将 LLM 输出映射为精准的空间动作。在 12 人被试内实验中,与纯语音基线相比,该手势显著提升了空间指代与交互效果。

8月25日周二
  1. Hugging Face Blog66

    IBM Granite 4.2 推理模型家族发布,3B/8B/30B 全系采用 Apache 2.0 开源

    IBM 发布 Granite 4.2 推理模型家族,包含 3B、8B、30B 三个 dense 尺寸,基于 Granite-4.1 基座(从头预训练约 15T tokens,五阶段策略将上下文窗口扩展至 512K tokens),经 CoT 与智能体轨迹数据的 SFT 后,再用异步 GRPO 多阶段 RL 流水线后训练。

    推荐理由:官方完整披露 Granite 4.2 的五阶段预训练、SFT 配比与多阶段 RL 课程设计,读者可以直接对照复现其训练路线。

8月22日周六
8月19日周三
8月14日周五
8月13日周四
  1. Hugging Face Blog76

    Hugging Face 复盘 ICML 2026 论文复现挑战赛:1,221 人复现 2,226 篇论文

    Hugging Face 复盘今年 7 月 15 日至 8 月 2 日举办的 ICML 2026 Open Reproductions 挑战赛:1,221 名社区成员用 Claude Code、Codex、Cursor 等智能体,19 天发布 6,816 份 Trackio 日志,尝试复现 2,226 篇论文,约占会议论文的 34%。

    推荐理由:文中给出按声明逐条复核会议论文的结果分布和典型的证伪案例,读者可以借此理解智能体复现研究中人类角色的边界。

8月11日周二
8月10日周一
7月31日周五
  1. Microsoft Research62

    Microsoft Research 发布 Echoverse 计算机使用 Agent 训练环境并开源四个世界

    Microsoft Research 推出 Echoverse,为计算机使用 Agent 构建了 12 个深度训练环境,包括 10 个领域世界和 2 个能力世界(日期选择器与嵌套过滤)。

    推荐理由:原文给出深度世界优于浅层世界的实验对比和开源入口,读者可以据此判断合成训练环境如何影响 Agent 训练。

7月28日周二
  1. Google DeepMind69

    Google DeepMind 发布 Gemini Robotics 2,实现机器人全身智能控制

    Google DeepMind 发布 Gemini Robotics 2 系列机器人模型,包含 VLA 模型 Gemini Robotics 2、具身推理模型 Gemini Robotics ER 2 和端侧模型 Gemini Robotics On-Device 2。

    推荐理由:官方一次性放出 VLA、具身推理和端侧三个机器人模型,读者可以借此了解全身控制、灵巧操作与多机协作的具体进展。

7月27日周一
  1. Hugging Face Blog85

    Hugging Face 技术复盘 2026 年 7 月智能体入侵事件:约 17600 个攻击动作的完整时间线

    Hugging Face 发布入侵事件技术复盘,还原一个由 OpenAI 模型驱动的自主智能体在约 4.5 天内对其生产基础设施发起的端到端入侵。

    推荐理由:当事方逐日复盘一次智能体入侵的完整攻击链与防御整改,读者可以借此理解机器速度攻击带来的防守不对称问题。

7月26日周日
  1. Berkeley AI Research49

    ABBEL:教 LLM 更新信念状态以实现高效长程交互

    Berkeley AI Research 提出 ABBEL 框架,将大语言模型在长程交互中的摘要形式化为自然语言信念状态,并通过信念评分监督其信息内容。在 CollabBench 协作编程环境中,基于重构的信念评分使 ABBEL-rec-BG 将与全上下文模型的性能差距缩小约 50%,训练步数从 100 减至 50,且峰值上下文 token 长度仍显著低于全上下文设置。

7月21日周二
7月16日周四
  1. Hugging Face Blog85

    Hugging Face 披露由自主 AI 智能体驱动的入侵事件及应对

    Hugging Face 披露本周检测并处置了一起由自主 AI 智能体系统端到端驱动的入侵,攻击者通过恶意数据集利用两条代码执行路径获得处理节点访问权限,窃取了部分内部数据集和多项服务凭证。

    推荐理由:披露一起由自主智能体发起的入侵及 AI 取证应对细节,读者可以了解防御侧如何在护栏限制下自建可用模型能力。

7月15日周三
  1. Hugging Face Blog81

    Thinking Machines 发布开源多模态大模型 Inkling 及 Inkling-Small

    Thinking Machines 在 Hugging Face 发布开源多模态模型 Inkling,总计 975B 参数、激活 41B 的 MoE 架构,原生接受图像、文本和音频输入,支持 1M 上下文,训练数据为 45 万亿 token。

    推荐理由:原文给出 Inkling 与 Inkling-Small 的架构细节、部署配置和多份基准数字,可帮助读者评估其在多模态推理场景的可用性。

7月7日周二
7月1日周三
6月25日周四
  1. Google DeepMind71

    Gemini 3.5 Flash 内置 computer use 能力

    Google DeepMind 宣布 computer use 成为 Gemini 3.5 Flash 的内置工具,此前该能力仅以独立的 Gemini 2.5 computer use 模型提供。

    推荐理由:官方说明 computer use 从独立模型并入 Gemini 3.5 Flash 主模型的定位变化,并给出配套安全机制与使用入口,读者可据此评估迁移时机。

6月24日周三
6月17日周三
6月16日周二