跳到正文

#产品更新

今日 17 条
5月16日周六
5月6日周三
4月27日周一
4月23日周四
  1. Google Research62

    Google Photos Auto frame 上线 3D 视角重组功能

    Google 在 Google Photos 的 Auto frame 功能中推出新方法,可在拍摄后调整照片的相机视角。方法先用内部 3D 点图估计模型重建场景并近似焦距,再用生成式 latent diffusion 模型补全新视角下的空洞,并自动检测广角前置镜头的人脸透视畸变,自动为含有人物的合格照片生成重组后的第二候选版本。

    推荐理由:原文解释了用 3D 点图加生成补全改换拍摄视角的两阶段方法,读者可以理解它与普通裁剪编辑的本质差别。

4月14日周二
4月9日周四
3月31日周二
  1. Mistral AI67

    Mistral AI 发布 Spaces CLI,为人类与智能体提供统一开发工具

    Mistral AI 发布 Spaces CLI,用于脚手架搭建、开发环境启动和部署,最初为内部解决方案团队构建,后发现智能体也成为主要用户。文章总结核心设计原则:每个交互式输入都有等价 flag、用 context. 和 AGENTS.md 为智能体提供项目上下文、显式化状态替代 CWD 隐式依赖,并用插件注册表作为唯一数据源;一个智能体曾据此从单个提示词在 10 分钟内完成配置生成与部署。

    推荐理由:Mistral 以自家 CLI 实战总结出一套让人类与智能体共用的开发工具设计原则,可直接迁移到自己的工具链构建。

3月29日周日
  1. Google DeepMind60

    Google DeepMind 推出 Gemini 驱动的 AI 智能指针并落地 Chrome 与 Googlebook

    Google DeepMind 发布由 Gemini 驱动的实验性 AI 智能指针,提出维持流程、所见即所指、用 This/That 简化指令、把像素变成可交互实体四项交互原则,让 AI 理解用户指向的内容与意图。

    推荐理由:原文给出交互原则和已在 Chrome 与 Googlebook 落地的入口,读者可据此评估指向式 AI 交互对现有提示词工作流的影响。

3月25日周三
3月18日周三
3月12日周四
  1. Google Research62

    Google 在 Flood Hub 推出 AI 驱动的城市山洪预报,可提前 24 小时预测

    Google 宣布在 Flood Hub 上线 Urban Flash Flood 预报,用 AI 方法提前最多 24 小时预测城市山洪风险。其 Groundsource 方法用 Gemini 分析公开新闻报道构建历史山洪数据集,训练基于 LSTM 的 RNN 模型,仅依赖全球气象产品即可运行,空间分辨率 20x20 公里,覆盖人口密度大于每平方公里 100 人的城市区域。

    推荐理由:原文给出模型方法、精度数据和与 NWS 的对比,读者可了解 AI 山洪预报在缺监测地区的实际表现。

  2. Google Research60

    Google 发布 Groundsource:用 Gemini 将新闻报道转化为灾害历史数据

    Google 发布 Groundsource,利用 Gemini 从 80 种语言的新闻中提取结构化洪水事件数据,构建覆盖 150 多个国家、2000 年至今的 260 万条城市山洪记录并开放获取。

    推荐理由:原文给出方法细节、准确率数字和开放数据入口,读者可据此评估 LLM 构建灾害历史数据集的可复用路径。

1月28日周三
10月24日周五
9月2日周二
  1. Mistral AI48

    Mistral AI 推出 Le Chat 记忆功能(beta):透明、可控、可迁移

    Mistral AI 在 Le Chat 中推出记忆功能(beta),采用混合方案:自动保存有用信息,召回时可见并附来源链接。用户可随时关闭记忆、开启隐身聊天、编辑或删除单条记忆,并支持导入导出。配套的 Memory Insights 能基于用户数据呈现趋势与摘要,后续还将支持记忆分类和即时遗忘。

7月30日周三
7月17日周四
7月3日周四
6月4日周三
5月27日周二
  1. Mistral AI66

    Mistral 发布 Agents API,内置代码执行、网页搜索、图像生成与 MCP 工具

    Mistral 发布新的 Agents API,将语言模型与代码执行、网页搜索、图像生成、Document Library 及 MCP 工具等内置连接器结合,并支持跨对话的持久记忆与智能体编排。

    推荐理由:官方公告完整列出了内置连接器、记忆机制与编排方式,读者可以据此判断这套 API 如何简化智能体场景的搭建。

3月7日周五
  1. Mistral AI62

    Mistral 发布 OCR API,主打复杂文档理解

    Mistral AI 发布光学字符识别 API Mistral OCR,接受图像和 PDF 输入,以有序的图文交错形式提取内容,定位为搭配 RAG 系统处理多模态文档的模型。

    推荐理由:官方给出完整基准对比、定价和部署选项,读者可以据此评估它在文档理解和 RAG 流程中的实际适用性。