Gemini 3.5 Flash 内置 computer use 能力
Google DeepMind 宣布 computer use 成为 Gemini 3.5 Flash 的内置工具,此前该能力仅以独立的 Gemini 2.5 computer use 模型提供。
推荐理由:官方说明 computer use 从独立模型并入 Gemini 3.5 Flash 主模型的定位变化,并给出配套安全机制与使用入口,读者可据此评估迁移时机。
AI 产品与应用的功能上新、改版与商业化动态——谁家的产品变强了、变贵了、能用了。
Google DeepMind 宣布 computer use 成为 Gemini 3.5 Flash 的内置工具,此前该能力仅以独立的 Gemini 2.5 computer use 模型提供。
推荐理由:官方说明 computer use 从独立模型并入 Gemini 3.5 Flash 主模型的定位变化,并给出配套安全机制与使用入口,读者可据此评估迁移时机。
段已按要求撰写
推荐理由:原文给出 70 多种语言的近实时语音翻译能力、流式生成机制和各产品线的开放入口,读者可以据此判断它对会议和翻译场景的实际影响。
Mistral 发布统一 AI 智能体 Vibe,将 Le Chat 整合为一套智能体和许可证,工作与编码场景共用。
推荐理由:Mistral 官方把 Le Chat 升级为统一智能体 Vibe,原文给出 Work 与 Code 两种模式的具体能力和定价,可据此评估对现有工作流的影响。
Google DeepMind 宣布扩展内容透明度与验证工具,覆盖 Search、Gemini、Chrome、Pixel 和 Cloud。
推荐理由:官方公布了 SynthID 验证与 C2PA 内容凭证在 Gemini、Search、Chrome 等产品中的扩展计划,读者可据此了解内容溯源工具的实际落地范围。
Google DeepMind 汇总 AlphaEvolve(Gemini 驱动的编码智能体)发布一年的主要成果。
推荐理由:官方汇总了 AlphaEvolve 一年来在科学研究和商业场景的具体应用结果,读者可以据此了解该智能体在各领域的落地方式和量化成效。
Google 在 Google Photos 的 Auto frame 功能中推出新方法,可在拍摄后调整照片的相机视角。方法先用内部 3D 点图估计模型重建场景并近似焦距,再用生成式 latent diffusion 模型补全新视角下的空洞,并自动检测广角前置镜头的人脸透视畸变,自动为含有人物的合格照片生成重组后的第二候选版本。
推荐理由:原文解释了用 3D 点图加生成补全改换拍摄视角的两阶段方法,读者可以理解它与普通裁剪编辑的本质差别。
Mistral AI 发布 Spaces CLI,用于脚手架搭建、开发环境启动和部署,最初为内部解决方案团队构建,后发现智能体也成为主要用户。文章总结核心设计原则:每个交互式输入都有等价 flag、用 context. 和 AGENTS.md 为智能体提供项目上下文、显式化状态替代 CWD 隐式依赖,并用插件注册表作为唯一数据源;一个智能体曾据此从单个提示词在 10 分钟内完成配置生成与部署。
推荐理由:Mistral 以自家 CLI 实战总结出一套让人类与智能体共用的开发工具设计原则,可直接迁移到自己的工具链构建。
Google DeepMind 发布由 Gemini 驱动的实验性 AI 智能指针,提出维持流程、所见即所指、用 This/That 简化指令、把像素变成可交互实体四项交互原则,让 AI 理解用户指向的内容与意图。
推荐理由:原文给出交互原则和已在 Chrome 与 Googlebook 落地的入口,读者可据此评估指向式 AI 交互对现有提示词工作流的影响。
Google 宣布在 Flood Hub 上线 Urban Flash Flood 预报,用 AI 方法提前最多 24 小时预测城市山洪风险。其 Groundsource 方法用 Gemini 分析公开新闻报道构建历史山洪数据集,训练基于 LSTM 的 RNN 模型,仅依赖全球气象产品即可运行,空间分辨率 20x20 公里,覆盖人口密度大于每平方公里 100 人的城市区域。
推荐理由:原文给出模型方法、精度数据和与 NWS 的对比,读者可了解 AI 山洪预报在缺监测地区的实际表现。
Google 发布 Groundsource,利用 Gemini 从 80 种语言的新闻中提取结构化洪水事件数据,构建覆盖 150 多个国家、2000 年至今的 260 万条城市山洪记录并开放获取。
推荐理由:原文给出方法细节、准确率数字和开放数据入口,读者可据此评估 LLM 构建灾害历史数据集的可复用路径。
Mistral 发布终端原生编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型驱动,新增自定义子智能体、多选项澄清、斜杠命令技能和统一智能体模式。
推荐理由:官方公布了 Mistral Vibe 2.0 的具体新能力和套餐定价,读者可以据此判断终端智能体工作流如何配置与迁移。
Mistral 发布新的 Agents API,将语言模型与代码执行、网页搜索、图像生成、Document Library 及 MCP 工具等内置连接器结合,并支持跨对话的持久记忆与智能体编排。
推荐理由:官方公告完整列出了内置连接器、记忆机制与编排方式,读者可以据此判断这套 API 如何简化智能体场景的搭建。
Mistral AI 发布光学字符识别 API Mistral OCR,接受图像和 PDF 输入,以有序的图文交错形式提取内容,定位为搭配 RAG 系统处理多模态文档的模型。
推荐理由:官方给出完整基准对比、定价和部署选项,读者可以据此评估它在文档理解和 RAG 流程中的实际适用性。