Google DeepMind 发布 Gemini for Science 科学工具集与 Science Skills
Google DeepMind 推出 Gemini for Science,包含 Google Labs 上三个实验工具:基于 Co-Scientist 的 Hypothesis Generation。
Google DeepMind 推出 Gemini for Science,包含 Google Labs 上三个实验工具:基于 Co-Scientist 的 Hypothesis Generation。
Google DeepMind 发布 Gemini 3.5 模型系列,首发 Gemini 3.5 Flash,主打智能体与编码性能,3.5 Pro 将于下月推出。
推荐理由:官方发布给出了 3.5 Flash 在编码与智能体基准上的具体成绩、速度对比和开放渠道,读者可据此评估替换现有工作流模型的收益。
Google DeepMind 在 Nature 发表 Co-Scientist 研究,推出基于 Gemini 的多智能体 AI 系统,可迭代生成、辩论和进化科学假设,并通过 Hypothesis Generation 实验工具向个人研究者开放,未来几周开始推出,可在 labs.google/science 注册。
推荐理由:原文给出系统架构、验证机制和多个实验室实测结果,读者可以据此评估多智能体假设生成的实际科研用法。
Google DeepMind 汇总 AlphaEvolve(Gemini 驱动的编码智能体)发布一年的主要成果。
推荐理由:官方汇总了 AlphaEvolve 一年来在科学研究和商业场景的具体应用结果,读者可以据此了解该智能体在各领域的落地方式和量化成效。
Jack Clark 在 Import AI 455 撰文判断,2028 年底前出现 AI 自主训练后继模型的概率超过 60%,2027 年为 30%。
Mistral AI 发布 Workflows 公开预览版,定位为企业 AI 编排层,ASML、ABANCA、CMA-CGM 等机构已用于生产自动化。
Google Research 在 ICLR 论文中提出 ReasoningBank,一个从成功与失败经验中提炼结构化推理记忆的智能体记忆框架,并配套 MaTTS 记忆感知测试时扩展方法。
Google DeepMind 宣布与 Accenture、Bain & Company、BCG、Deloitte 和 McKinsey 合作,帮助企业大规模采用前沿 AI。合作包括三大支柱:开发行业专属 AI 解决方案、让合作伙伴提前体验包括 Gemini 系列在内的前沿模型、以及安排 AI 领导层与客户 CEO 和董事会对接。重点覆盖金融、制造、零售和媒体娱乐等行业。
Berkeley AI Research 等团队提出 GRASP,一种基于梯度的世界模型规划器,让长时程规划更实用。方法包括将轨迹提升到虚拟状态以实现跨时间并行的优化、在状态迭代中直接加入随机性以促进探索,并对梯度进行重塑以避开高维视觉模型中脆弱的 state-input 梯度。
Google Research 与纽约大学合作推出研究实验 Vantage,让学习者在多 AI 头像模拟对话中练习和测评批判性思维、协作、创造性思维等面向未来的技能。
Google Research 推出 ConvApparel 数据集,包含 4,000 多段服装购物领域的人机多轮对话(近 15,000 轮),用于量化 LLM 用户模拟器与真实人类行为的真实感差距。
Google Research 推出两个学术智能体框架:PaperVizAgent(前身 PaperBanana)用于从论文文本生成出版级学术图表,ScholarPeer 用于自动化同行评审。
Google DeepMind 发布 Gemma 4 开源模型,称其为迄今最智能的开放模型,采用 Apache 2.0 许可,提供 E2B、E4B、26B MoE 和 31B Dense 四种尺寸。
推荐理由:官方发布给出四个尺寸、榜单名次、上下文长度与部署路径等具体信息,读者可据此评估选型和端侧部署方案。
Mistral AI 发布 Spaces CLI,用于脚手架搭建、开发环境启动和部署,最初为内部解决方案团队构建,后发现智能体也成为主要用户。文章总结核心设计原则:每个交互式输入都有等价 flag、用 context. 和 AGENTS.md 为智能体提供项目上下文、显式化状态替代 CWD 隐式依赖,并用插件注册表作为唯一数据源;一个智能体曾据此从单个提示词在 10 分钟内完成配置生成与部署。
推荐理由:Mistral 以自家 CLI 实战总结出一套让人类与智能体共用的开发工具设计原则,可直接迁移到自己的工具链构建。
Google 发布 Vibe Coding XR 工作流,结合 Gemini 与基于 WebXR、three.js、LiteRT.js 的开源 XR Blocks 框架,可将自然语言在 60 秒内转为支持物理效果的 Android XR 应用。
Mistral AI 推出 Forge,让企业基于内部文档、代码库等专有数据训练前沿级模型和智能体。Forge 支持预训练、后训练和强化学习全流程,兼容 dense 与 MoE 架构及多模态输入,可由 Mistral Vibe 等智能体用自然语言完成微调、超参数优化和合成数据生成。
Mistral 发布 Leanstral,一个专为 Lean 4 证明助手设计的开源代码智能体模型,采用稀疏架构(6B 激活参数,Leanstral-120B-A6B),权重以 Apache 2.0 许可开放,并可通过 Mistral Vibe 和 labs-leanstral-2603 免费或近免费 API 使用。
Mistral 基于其开源编程助手 Vibe 构建了一个自主智能体,可读取 Rails 源文件、生成或改进 RSpec 测试,并通过 RuboCop 和 SimpleCov 工具在 CI/CD 流水线中无人工干预地并行运行。
推荐理由:原文给出可复用的 AGENTS.md、分文件类型 skills 和强制执行测试的做法,以及质量分从 0.49 升到 0.74 的实验数据。
Mistral 发布终端原生编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型驱动,新增自定义子智能体、多选项澄清、斜杠命令技能和统一智能体模式。
推荐理由:官方公布了 Mistral Vibe 2.0 的具体新能力和套餐定价,读者可以据此判断终端智能体工作流如何配置与迁移。
Mistral 发布开源编码模型 Devstral 2(123B,修改版 MIT 协议)与 Devstral Small 2(24B,Apache 2.0),SWE-bench Verified 分别为 72.2% 和 68.0%,支持 256K 上下文窗口。
推荐理由:官方发布给出 SWE-bench Verified 分数、API 定价和部署门槛,可据此评估这款开源编码模型的实际性价比。
Mistral 推出 Mistral AI Studio,一个面向企业的生产级 AI 平台,解决原型难以进入生产阶段的痛点。平台包含三大支柱:Observability(含 Explorer、Judges、Datasets 等评估观测能力)、基于 Temporal 的 Agent Runtime(支持容错、可复现的执行)、以及管理资产版本与治理的 AI Registry。
Mistral AI 发布 Codestral 25.08,并整合 Codestral Embed、Devstral 和 Mistral Code IDE 插件组成企业级编码栈。
Mistral AI 与 All Hands AI 合作推出 Devstral Medium,并升级 Devstral Small 1.1。
Mistral 发布面向企业的 AI 编码助手 Mistral Code,基于开源项目 Continue 构建,集成 Codestral、Codestral Embed、Devstral 和 Mistral Medium 四个模型,支持 JetBrains IDE 和 VSCode,今日开放私测。
Mistral 发布新的 Agents API,将语言模型与代码执行、网页搜索、图像生成、Document Library 及 MCP 工具等内置连接器结合,并支持跨对话的持久记忆与智能体编排。
推荐理由:官方公告完整列出了内置连接器、记忆机制与编排方式,读者可以据此判断这套 API 如何简化智能体场景的搭建。
Mistral AI 与 All Hands AI 合作发布面向软件工程任务的智能体模型 Devstral,以 Apache 2.0 许可开源。
推荐理由:官方给出了 SWE-Bench Verified 成绩、部署门槛和 API 定价,开源编码模型选型可据此对比。
Mistral AI 推出 TranscriptToPRDTicket agentic workflow,可将会议记录自动转化为 PRD 和可执行的开发工单。该流程由 Mistral Large 2 驱动 PRDAgent 和 TicketCreationAgent 两个组件,并自动在 Linear、Jira 等项目管理工具中创建工单。