NVIDIA 发布开源表格基础模型 Kumo Tabular
NVIDIA 发布开源表格基础模型 Kumo Tabular,对分类和回归任务无需训练、调参或特征工程,单次前向传播即可预测新行标签,权重已在 Hugging Face 开放,采用 OpenMDW-1.1 许可证。
NVIDIA 发布开源表格基础模型 Kumo Tabular,对分类和回归任务无需训练、调参或特征工程,单次前向传播即可预测新行标签,权重已在 Hugging Face 开放,采用 OpenMDW-1.1 许可证。
波士顿语音智能初创公司 Modulate 完成 2500 万美元融资,由 Future Ventures 领投,Hyperplane 和 Lakestar 参投,此前融资总额达 4100 万美元、估值 1.7 亿美元。
AWS 在 Amazon EKS 上结合 Elastic Fabric Adapter(EFA)和 DeepEP,构建了加速 MoE 模型大规模强化学习训练的架构,吞吐量提升 40%。
本文演示在 Amazon SageMaker HyperPod 上用开源 RL 框架 SkyRL 训练 Qwen3-VL-8B 视觉语言模型完成视觉迷宫导航任务。
新泽西州对 DataOne 的 Vineland 数据中心处以 110 万美元罚款,因其未经许可安装并运行 62 台燃气发电机,其中 45 台在被 Guardian 与 Floodlight 的热成像无人机曝光时正在运行,部分功率达 1982 千瓦、超出州限 50 多倍。
Google 将于 10 月 1 日发射首颗 Project Suncatcher 试验卫星 MVP,验证轨道 AI 数据中心构想。这颗冰箱大小的卫星由 Planet Labs 建造,搭载 4 颗 Google 定制 TPU,太阳能板供电约 1 千瓦;原计划 2027 年发射两颗定制卫星,Google 选择加快节奏提前测试。
UK AI Security Institute(AISI)开始使用 EvalEval 的基础设施公开发布评测结果,推动评测科学更可复现、可验证。
TypeSafe AI CEO Diogo Almeida 在 Latent Space 播客中介绍其新模型 Jev 的定位,即面向软件而非聊天的 System One 大型可编程模型,名字取自 Jevons Paradox,主打单位美元智能。
NVIDIA Vera Rubin NVL72 首次提交 MLPerf Inference v6.1 预览成绩,在 Qwen3-VL 上吞吐最高达 GB300 NVL72 的 3.7x,在 DeepSeek-R1 上达 2.5x,使用 vLLM、Dynamo 和 TensorRT-LLM。
Good Start Labs 将 Diplomacy、1830 铁路棋等桌游改造为 AI 训练环境,公司从 Every 分拆而来,获 360 万美元融资,投资方包括 General Catalyst、Inovia 和 Every。
Google Research 在 ICML 2026 论文中提出 Retrieve-for-Train 框架,通过离线 RL 将奖励对齐的查询 fan-out 编译为监督信号,蒸馏进 53.9M 参数的扩散检索器,实现单次非自回归查询扩展,免去测试时的 CoT 思考 token 开销。
Google Research 在 ACL 2026 提出 ToolGrad,采用“先答案后提问”的范式生成工具使用训练数据,通过文本“梯度”迭代构建 API 调用链,几乎达到 100% 通过率且成本更低。
OpenAI 推出 ChatGPT Work 中的 Data agent,支持连接公司数据、发现洞察,并用自然语言构建交互式仪表盘。该功能面向企业数据分析场景,通过 AI 简化从数据到可视化呈现的流程。
Hugging Face 发布完整教程,用 TRL 库的 GRPO 结合 LoRA 微调 LiquidAI/LFM2.5-350M,仅需约 500 样本和 100 步训练即可在免费级 Colab 或 Kaggle 16 GB GPU 上完成。
推荐理由:完整开源了小模型 GRPO 结构化输出微调的配方和评测对比,资源门槛低,方法可直接迁移到其他小模型任务。
Google Research 推出 GlucoFM,一个自监督双流架构的连续血糖监测(CGM)基础模型,将缓慢血糖趋势与短期波动分开建模。该模型在 109,066 小时无标注 CGM 数据上预训练,在 4 个队列、7 项临床预测任务共 14 项评估中,平均 PR-AUC 比最强基线 GluFormer 高 5.8 个百分点,并在餐后血糖反应预测中取得最低 MAE。
Multiverse Computing 发布论文 Quantization-Aware Healing,提出 QAH 方法:直接从压缩前的原始模型蒸馏,修复经过结构压缩并量化到 MXFP4 的模型。
Microsoft Research 发布深度学习 DFT 泛函 Skala 1.1,训练数据较前一版增加 2.5 倍,在 GMTKN55 基准的 55 个类别中 32 个排名第一,加权平均误差 2.8 kcal/mol,超过最昂贵的 global hybrid 泛函,同时保持 meta-GGA 级计算成本。
IBM Research 在 AppWorld 上以同一 ReAct 智能体对比自家的 ALTK-Evolve 与 ACE,指出两者都拒绝压缩经验,差异在交付方式:ACE 每步注入完整 playbook,ALTK-Evolve 按模型能力选择性检索 guidelines。
Multiverse Computing 发布论文,用缓存教师模型 top-100 logits 的离线蒸馏和融合分块 KL 损失两项系统改动降低知识蒸馏成本。
Microsoft Research 推出 Echoverse,为计算机使用 Agent 构建了 12 个深度训练环境,包括 10 个领域世界和 2 个能力世界(日期选择器与嵌套过滤)。
推荐理由:原文给出深度世界优于浅层世界的实验对比和开源入口,读者可以据此判断合成训练环境如何影响 Agent 训练。
Microsoft Research 推出 EvoLib,一个让大语言模型在推理时从自身经验自监督学习、无需更新模型的框架。它把成功方案提炼为可复用技能、把错误提炼为反思性洞见,并通过整合与动态加权机制持续演化知识。
Berkeley AI Research 提出 ABBEL 框架,将大语言模型在长程交互中的摘要形式化为自然语言信念状态,并通过信念评分监督其信息内容。在 CollabBench 协作编程环境中,基于重构的信念评分使 ABBEL-rec-BG 将与全上下文模型的性能差距缩小约 50%,训练步数从 100 减至 50,且峰值上下文 token 长度仍显著低于全上下文设置。
Google Research 发布大型传感器基础模型 SensorFM,在 500 万名同意参与者的超过一万亿分钟多模态可穿戴信号上自监督预训练。模型输入 PPG、加速度计、EDA、皮温和测高五类模态共 34 个一分钟聚合特征,采用 AIM 框架直接从不完整数据中学习。
推荐理由:Google 自述其可穿戴基础模型的数据规模、AIM 缺失数据处理方法与下游结果,读者可了解可穿戴健康数据通用表示的可行路径。
Mistral AI 发布首个具身导航模型 Robostral Navigate,8B 参数,仅用单个 RGB 相机即可按自然语言指令自主导航。
Photoroom 发布 PRX 系列博客第 4 篇,公开 7B 文生图模型的预训练数据管线:混合公开与内部数据集,用 VLM 重标注全部图片,转成 MDS 流式语料。
Dharma AI 解读 Goldfeder、Wyder、LeCun 与 Shwartz-Ziv 2026 年论文《AI Must Embrace Specialization via Superhuman Adaptable Intelligence》,论证专业化是有效 AI 系统的必然路径。
Hugging Face 提出 DiScoFormer,单个 Transformer 通过一次前向传播即可估计任意数据集背后的分布密度与 score,无需针对新分布重训。
Google Research 将在 COLM 2026 发表的论文发现,开启链式推理可让 Gemini-2.5(Flash 和 Pro)与 Qwen3-32B 召回推理关闭时几乎无法给出的单跳事实答案。
推荐理由:论文给出两类机制实验和幻觉审计结果,读者可以据此理解推理为何能帮助单跳事实召回以及其局限。
Import AI 第462期汇总多篇研究:牛津等机构四项实验共18,978次对话显示AI说服力稳定超过专家人类,Opus 4.1和Opus 4.6最强,真人募捐实验中AI比专业募捐者多筹10.8个百分点。
Google Research 在 AISTATS 2026 提出 Regularized f-Divergence Kernel Tests,一个用于审计机器遗忘的统计测试框架,比传统 two-sample testing 更灵敏灵活。
Google DeepMind 介绍斯坦福医学院 Gary Peltz 团队发表于 Advanced Science 的研究,用 Co-Scientist 从既有药物文献中筛选可重定位治疗肝纤维化的候选药。
Google DeepMind 推出分布式训练架构 Decoupled DiLoCo,将训练拆分为异步通信的计算“孤岛”(learner units),隔离硬件故障对整体训练的影响。
Google Research 在 TMLR 论文中推出 Simula,一种 seedless、agentic 的“推理优先”合成数据生成框架,将数据集生成重构为机制设计问题,通过全局多样性、局部多样性、复杂化与双 critic 质量检查四个可控轴独立调控覆盖面、复杂度和质量。
Google Research 推出 ConvApparel 数据集,包含 4,000 多段服装购物领域的人机多轮对话(近 15,000 轮),用于量化 LLM 用户模拟器与真实人类行为的真实感差距。
Google Research 在论文 "Forest vs Tree: The (N,K) Trade-off in Reproducible ML Evaluation" 中研究了评测基准中条目数量与每条标注者人数的权衡。
Google Research 在 Earth AI 计划下推出 S2Vec,一个自监督框架,可将建筑环境转化为通用嵌入向量。它先用 S2 Geometry 将地球表面划分为分层 cell,再把特征栅格化为多层图像,并通过掩码自编码(MAE)无需人工标签地学习位置特征。
Mistral AI 推出 Forge,让企业基于内部文档、代码库等专有数据训练前沿级模型和智能体。Forge 支持预训练、后训练和强化学习全流程,兼容 dense 与 MoE 架构及多模态输入,可由 Mistral Vibe 等智能体用自然语言完成微调、超参数优化和合成数据生成。
Berkeley AI Research 提出 SPEX 和 ProxySPEX 算法,利用稀疏性和低阶性等结构性质,以远少于传统方法的消融次数识别 LLM 中影响输出的特征、数据与内部组件交互。
Google 发布 Groundsource,利用 Gemini 从 80 种语言的新闻中提取结构化洪水事件数据,构建覆盖 150 多个国家、2000 年至今的 260 万条城市山洪记录并开放获取。
推荐理由:原文给出方法细节、准确率数字和开放数据入口,读者可据此评估 LLM 构建灾害历史数据集的可复用路径。
Google Research 发布开放语音数据集 WAXAL,覆盖 27 种撒哈拉以南非洲语言,使用者超过 1 亿人、分布于 26 个国家。数据集包含约 1,846 小时经转写的自然语音(WAXAL-ASR,采用图像提示引发自发语音)和超过 565 小时高保真 TTS 录音,以 CC-BY-4.0 许可开放,由 Makerere 大学、加纳大学等非洲学术与社区组织主导采集。