ProvenanceGuard:面向 MCP 智能体的来源感知事实性验证
Hugging Face 团队提出 ProvenanceGuard,一个针对基于 MCP 的 LLM 智能体的生成后验证层,能检测“跨来源混淆”——事实存在但被归因到错误来源的情况。
Hugging Face 团队提出 ProvenanceGuard,一个针对基于 MCP 的 LLM 智能体的生成后验证层,能检测“跨来源混淆”——事实存在但被归因到错误来源的情况。
Google Research 推出 AI 视频联合导演研究,基于 Gemini 和 Veo 构建统一多智能体框架,包含 Co-Director、CANVAS、A²RD 和 VQQA 四套框架,将长视频生成建模为全局优化与世界状态跟踪问题。
Microsoft Research 通过系统性测量研究指出,仅依赖机器人机载 GPU 会限制性能、续航与可扩展性。实验显示小型 GPU 上地图与规划最高慢 383%,导航障碍及时检测率下降 30%,VLA 模型准确率下降 50%;换成 Raspberry Pi-5 并卸载推理可显著延长电池时间,Jetson Thor 等机载 GPU 对机器人的电池消耗高达 160%。
IBM Research 在开源工具 ALTK-Evolve 中新增一致性指南与 Consistency Analyzer,针对平均准确率掩盖的可靠性问题。
Google Research 在 ACL 2026 提出 ToolGrad,采用“先答案后提问”的范式生成工具使用训练数据,通过文本“梯度”迭代构建 API 调用链,几乎达到 100% 通过率且成本更低。
Google Earth AI 推出实验性研究能力行星预测引擎(PPE),可从自然语言查询出发自主完成数据发现、特征工程、模型训练与评估的完整地理空间预测流程,将原本需数周的人工建模缩短到数分钟。
Google 在 CHI 2026 发表 AgentHands,一个让 XR 中 AI 智能体生成与语音同步的 3D 手部手势的研究原型。系统由环境感知、手势事件库、手势嵌入推理和同步 XR 执行四个模块组成,将 LLM 输出映射为精准的空间动作。在 12 人被试内实验中,与纯语音基线相比,该手势显著提升了空间指代与交互效果。
IBM Research 在 AppWorld 上以同一 ReAct 智能体对比自家的 ALTK-Evolve 与 ACE,指出两者都拒绝压缩经验,差异在交付方式:ACE 每步注入完整 playbook,ALTK-Evolve 按模型能力选择性检索 guidelines。
Google Research 发布 Chain-of-Evidence 可验证性框架及其实例 Science One Framework,配套 CoE Audit 自动审计指标。
Microsoft Research 推出 EvoLib,一个让大语言模型在推理时从自身经验自监督学习、无需更新模型的框架。它把成功方案提炼为可复用技能、把错误提炼为反思性洞见,并通过整合与动态加权机制持续演化知识。
Jack Clark 在 Import AI 第 466 期汇总三条线索:Epoch 与 METR 发布 MirrorCode 基准,Opus 4.7 花 14 小时。
Berkeley AI Research 提出 ABBEL 框架,将大语言模型在长程交互中的摘要形式化为自然语言信念状态,并通过信念评分监督其信息内容。在 CollabBench 协作编程环境中,基于重构的信念评分使 ABBEL-rec-BG 将与全上下文模型的性能差距缩小约 50%,训练步数从 100 减至 50,且峰值上下文 token 长度仍显著低于全上下文设置。
Hugging Face 推出开源基准 ScarfBench,用于评测 AI 智能体在 Spring、Jakarta EE、Quarkus 三大 Java 生态间的框架迁移能力,包含 34 个应用、102 个框架实现、204 个迁移任务和 1,331 个专家编写测试。
King's College London、复旦大学与 The Alan Turing Institute 等构建了 SocioHack 基准,含 72 个沙盒社会环境(历史 32 个。
Google Research 在 ICLR 论文中提出 ReasoningBank,一个从成功与失败经验中提炼结构化推理记忆的智能体记忆框架,并配套 MaTTS 记忆感知测试时扩展方法。
Berkeley AI Research 等团队提出 GRASP,一种基于梯度的世界模型规划器,让长时程规划更实用。方法包括将轨迹提升到虚拟状态以实现跨时间并行的优化、在状态迭代中直接加入随机性以促进探索,并对梯度进行重塑以避开高维视觉模型中脆弱的 state-input 梯度。
Google Research 推出 ConvApparel 数据集,包含 4,000 多段服装购物领域的人机多轮对话(近 15,000 轮),用于量化 LLM 用户模拟器与真实人类行为的真实感差距。