IBM Research 用 ALTK-Evolve 测出智能体记忆的最优剂量因模型能力而异
IBM Research 在 Hugging Face Blog 发布 ALTK-Evolve 在 AppWorld 上跨八个模型的记忆校准研究,核心结论是智能体记忆不是开关而是按模型校准的剂量。
推荐理由:原文基于八个模型实测给出智能体记忆的剂量规律,弱模型靠精选检索、强模型用全集,兼顾精度与成本。
IBM Research 在 Hugging Face Blog 发布 ALTK-Evolve 在 AppWorld 上跨八个模型的记忆校准研究,核心结论是智能体记忆不是开关而是按模型校准的剂量。
推荐理由:原文基于八个模型实测给出智能体记忆的剂量规律,弱模型靠精选检索、强模型用全集,兼顾精度与成本。
Hugging Face 发布教程介绍 Sentence Transformers v6.0 新增的 MultiVectorEncoder,PyLate、Stanford-NLP ColBERT 及 colpali-engine 检查点可直接加载。
推荐理由:官方详解 Sentence Transformers v6.0 新增多向量模型类型的用法,从原理、代价到索引和视觉文档检索都可落地操作。
Hugging Face 演示了 Strands Robots 中一个智能体如何完成机器人数据流闭环:从自然语言提示录制 LeRobotDataset 并同步到 Storage Buckets,训练时通过 stream_dataset 直接流式读取数据而无需下载,再以 mode="real" 一个关键字参数变更即可将 checkpoint 部署回硬件。
IBM Research 团队结合在 Agent 系统中构建路由的实践,提出模型路由本质是系统优化而非分类问题。
Hugging Face 博客发布 Profiling in PyTorch 系列第三篇,用 profiler 分析注意力机制从朴素实现到 SDPA 各后端的表现。
推荐理由:文章用 profiler 逐一对注意力各实现读 trace,给出 kernel 数、耗时与占用率等一手数据,方法可直接迁移到自己的模型调优。
Photoroom 发布 PRX 系列博客第 4 篇,公开 7B 文生图模型的预训练数据管线:混合公开与内部数据集,用 VLM 重标注全部图片,转成 MDS 流式语料。
Mistral 基于其开源编程助手 Vibe 构建了一个自主智能体,可读取 Rails 源文件、生成或改进 RSpec 测试,并通过 RuboCop 和 SimpleCov 工具在 CI/CD 流水线中无人工干预地并行运行。
推荐理由:原文给出可复用的 AGENTS.md、分文件类型 skills 和强制执行测试的做法,以及质量分从 0.49 升到 0.74 的实验数据。
Mistral 展示了用 LoRA 微调 Pixtral-12B 处理卫星图像的方法,并在 Aerial Image Dataset(AID)上验证效果:数据集分为 8,000 训练样本和 2,000 测试样本。
Mistral 介绍用 "LLM as a Judge" 方式评估 RAG 系统:由 judge LLM 按数值、二元或定性量表给 generator LLM 的答案打分。
Mistral AI 推出 TranscriptToPRDTicket agentic workflow,可将会议记录自动转化为 PRD 和可执行的开发工单。该流程由 Mistral Large 2 驱动 PRDAgent 和 TicketCreationAgent 两个组件,并自动在 Linear、Jira 等项目管理工具中创建工单。