LLaMA 剪枝的物理学视角:把 Transformer block 删除转化为 Ising 优化问题
Multiverse 的最新论文将 LLM 深度剪枝中的 block 选择问题重构为约束二元优化(CBO),直接映射到 Ising glass 自旋系统,能量值成为剪枝后模型 benchmark 表现的廉价代理指标。
Multiverse 的最新论文将 LLM 深度剪枝中的 block 选择问题重构为约束二元优化(CBO),直接映射到 Ising glass 自旋系统,能量值成为剪枝后模型 benchmark 表现的廉价代理指标。
Multiverse Computing 发布论文,用缓存教师模型 top-100 logits 的离线蒸馏和融合分块 KL 损失两项系统改动降低知识蒸馏成本。
Google DeepMind 在 Nature 发表论文并开源 WeatherNext 2 和 WeatherNext Cyclones 模型,称其对气旋路径、强度和风结构的预报平均比现有模型多出约 24 小时提前量,相当于约十年气象学进展。
推荐理由:官方同时放出 Nature 论文与模型权重,读者可按论文结果自行复用或验证这套气旋预报方法。
IBM Research 与 UC Berkeley Sky Lab 基于 K-Search 进化式内核搜索框架构建 MLX 后端,通过结构化 CUDA 到 MLX 翻译层把既有 CUDA 内核知识转化为 Apple Silicon 的优化指引。
Berkeley AI Research 介绍了一种基于“分而治之”的 off-policy RL 价值学习算法,替代 TD learning。传统 TD learning 的 Bellman 递归会使误差随长 horizon 累积,TD-n 只能按常数因子减少递归次数,而分而治之可将递归次数按对数级降低,且无需调超参数 n。