Google DeepMind 发布塞拉利昂 Gemini Guided Learning 对照试验结果
Google DeepMind 公布在塞拉利昂开展的预注册对照试验结果,使用 Guided Learning 的学生数学成绩较对照组提升 0.258 个标准差,约相当于 1.2 至 1.7 年的常规学习进度。
推荐理由:原文给出预注册RCT的关键数据和开放式材料,读者可以了解AI辅助教学在真实课堂中的效果与局限。
Google DeepMind 公布在塞拉利昂开展的预注册对照试验结果,使用 Guided Learning 的学生数学成绩较对照组提升 0.258 个标准差,约相当于 1.2 至 1.7 年的常规学习进度。
推荐理由:原文给出预注册RCT的关键数据和开放式材料,读者可以了解AI辅助教学在真实课堂中的效果与局限。
Google 在 I/O 2026 上宣布推出 Gemini for Science,一套整合其基础研究成果的实验性科学工具套件。
剑桥大学 Clare Bryant 教授使用 Google DeepMind 的 Co-Scientist 研究病原体跨物种传播引发脓毒症等重症的分子开关。该工具根据其流感研究提案生成并排序假设,逐步将候选蛋白细化到具体氨基酸。原本需两到三年的实验验证工作有望在六个月内完成。
爱丁堡大学Filippo Menolascina团队使用Co-Scientist研究代谢功能障碍相关脂肪性肝炎(MASH),筛选潜在联合用药方案。系统针对药物resmetirom仅对部分患者有效的问题,提出NLRP3炎症小体是连接炎症与代谢的分子桥梁,该假说已获实验验证,有望推动双重靶向疗法。
Google DeepMind 的 Co-Scientist 正在连接 MIT 的 Ritu Raman 与 Boston Children's Hospital 的 Ryan Flynn 两个实验室,共同研究 ALS。
Google DeepMind 介绍斯坦福医学院 Gary Peltz 团队发表于 Advanced Science 的研究,用 Co-Scientist 从既有药物文献中筛选可重定位治疗肝纤维化的候选药。
Google DeepMind 发布 Gemini 3.5 模型系列,首发 Gemini 3.5 Flash,主打智能体与编码性能,3.5 Pro 将于下月推出。
推荐理由:官方发布给出了 3.5 Flash 在编码与智能体基准上的具体成绩、速度对比和开放渠道,读者可据此评估替换现有工作流模型的收益。
Berkeley AI Research 发文分析并行推理研究进展,核心问题是让推理模型自主决定何时分解并并行独立子任务、生成多少并发线程以及如何协调。文章梳理了从 Self-consistency、Best-of-N 到 Tree of Thoughts、MCTS 的固定并行方法,以及 ParaThinker、GroupThink、Hogwild!
Jack Clark 在 Import AI 455 撰文判断,2028 年底前出现 AI 自主训练后继模型的概率超过 60%,2027 年为 30%。
Google Research 在 ICLR 论文中提出 ReasoningBank,一个从成功与失败经验中提炼结构化推理记忆的智能体记忆框架,并配套 MaTTS 记忆感知测试时扩展方法。
Berkeley AI Research 等团队提出 GRASP,一种基于梯度的世界模型规划器,让长时程规划更实用。方法包括将轨迹提升到虚拟状态以实现跨时间并行的优化、在状态迭代中直接加入随机性以促进探索,并对梯度进行重塑以避开高维视觉模型中脆弱的 state-input 梯度。
Google DeepMind 发布 Gemma 4 开源模型,称其为迄今最智能的开放模型,采用 Apache 2.0 许可,提供 E2B、E4B、26B MoE 和 31B Dense 四种尺寸。
推荐理由:官方发布给出四个尺寸、榜单名次、上下文长度与部署路径等具体信息,读者可据此评估选型和端侧部署方案。
Google 推出 TurboQuant 压缩算法(ICLR 2026),在零精度损失下大幅缩减模型体积,同时支持 KV cache 压缩和向量搜索。其核心依赖 QJL 的零开销 1-bit 技巧与 PolarQuant 的极坐标压缩,消除了传统向量量化每数字 1-2 bit 的内存开销。
Mistral 发布 Mistral Small 4,是首个将 Magistral 推理、Pixtral 多模态和 Devstral 智能体编码能力统一到单一模型的小型旗舰,采用 Apache 2.0 许可开源。
推荐理由:原文给出架构参数、reasoning_effort 用法和与 GPT-OSS 120B 的输出效率对比,读者可据此评估部署成本与选型。
Google Research 与 Cornell 合作在 PNAS 发表论文,让 GPT-4o、Perplexity、Claude 3.5、Gemini Advanced Pro 1.5、NotebookLM 和自建 RAG 系统回答 67 个铜氧化物高温超导专家问题,由专家按 0 到 2 分多指标盲评。
Mistral 发布新一代模型系列 Mistral 3,包含 Mistral Large 3(41B 激活、675B 总参数的 MoE)以及 3B、8B、14B 三档 Ministral 3 模型,全部以 Apache 2.0 许可开源。
推荐理由:官方一次放出 675B MoE 旗舰与三档小模型,全部 Apache 2.0 开源并给出部署路径,适合评估开源选型空间。
Berkeley AI Research 介绍了一种基于“分而治之”的 off-policy RL 价值学习算法,替代 TD learning。传统 TD learning 的 Bellman 递归会使误差随长 horizon 累积,TD-n 只能按常数因子减少递归次数,而分而治之可将递归次数按对数级降低,且无需调超参数 n。
Berkeley AI Research 的新论文为 word2vec 的学习过程提供了定量预测理论:证明在若干温和近似条件下,其学习问题可归约为无加权最小二乘矩阵分解,梯度流动力学可解析求解,最终学到的表示等价于对特定目标矩阵 $M^\star$ 做 PCA。
Mistral AI 为 Le Chat 推出一批新功能,包括 Deep Research(预览)研究模式、基于 Voxtral 模型的语音模式、由 Magistral 推理模型驱动的多语言思考模式、Projects 项目文件夹,以及与 Black Forest Labs 合作的图像编辑。
Mistral AI 发布首个推理模型 Magistral,分为 24B 参数开源的 Magistral Small 和企业版 Magistral Medium。
推荐理由:官方公布两个版本的关键评测分数和开源许可,读者可以据此对比其在推理模型中的定位与可用部署方式。