Simon Willison 发布 commit-rewriter 0.2
Simon Willison 于 2026 年 9 月 24 日发布了 git 提交改写工具 commit-rewriter 的 0.2 版本。
Simon Willison 于 2026 年 9 月 24 日发布了 git 提交改写工具 commit-rewriter 的 0.2 版本。
Simon Willison 发布了其 LLM 命令行工具 llm 的 0.36 版本,于 2026 年 9 月 22 日在其博客上作为一条短讯公布。文中还提到其每月 10 美元的赞助订阅,订阅者可收到当月最重要 LLM 动态的精选邮件摘要。
UK AI Security Institute(AISI)开始使用 EvalEval 的基础设施公开发布评测结果,推动评测科学更可复现、可验证。
Simon Willison 于 2026 年 9 月 20 日发布了 datasette-explain 0.2.2 版本。原文未提供该版本的具体更新内容。
Google Research 推出 MilleMiglia,一个用 C++ 编写的实例生成器,可为中程(middle-mile)物流配送问题创建逼真的基准数据,源代码和文档已在 GitHub 上开源。中程物流负责区域或洲际尺度上配送中心之间的大宗货物运输,占总物流成本的相当大比例,但因数据敏感长期缺乏公开高质量数据。该工具将问题建模为时空图上的多商品流问题,可生成保护隐私的数据以支持后续研究。
Hugging Face 推出 BenchMIRT,一种基于多维 Item Response Theory 的方法,可在单个题目层面审计 LLM 基准测试实际测量的能力。
Microsoft Research 推出 Echoverse,为计算机使用 Agent 构建了 12 个深度训练环境,包括 10 个领域世界和 2 个能力世界(日期选择器与嵌套过滤)。
推荐理由:原文给出深度世界优于浅层世界的实验对比和开源入口,读者可以据此判断合成训练环境如何影响 Agent 训练。
Every Eval Ever(EEE)与 Hugging Face Community Evals 实现互通,EEE 结果可经转换器同步到 Hub 模型页和基准排行榜,并带来源徽章回链完整记录。
Berkeley AI Research 发文分析并行推理研究进展,核心问题是让推理模型自主决定何时分解并并行独立子任务、生成多少并发线程以及如何协调。文章梳理了从 Self-consistency、Best-of-N 到 Tree of Thoughts、MCTS 的固定并行方法,以及 ParaThinker、GroupThink、Hogwild!
Google Research 阐述其开源软件与开放数据集如何支持全球科学合作,相关资源已服务超过 250,000 名研究者和开发者。基因组学工具 DeepVariant、DeepConsensus、DeepPolisher 已帮助处理 250 万人的外显子组和全基因组,神经科学的 H01 数据集(1.4 petabyte 人脑组织样本)被访问超 200k 次。
Google Research 在论文 "Forest vs Tree: The (N,K) Trade-off in Reproducible ML Evaluation" 中研究了评测基准中条目数量与每条标注者人数的权衡。