跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

最新精选

第 21–27 条 · 共 27 条
5月17日周日
4月3日周五
3月29日周日
  1. Google DeepMind60

    Google DeepMind 推出 Gemini 驱动的 AI 智能指针并落地 Chrome 与 Googlebook

    Google DeepMind 发布由 Gemini 驱动的实验性 AI 智能指针,提出维持流程、所见即所指、用 This/That 简化指令、把像素变成可交互实体四项交互原则,让 AI 理解用户指向的内容与意图。

    推荐理由:原文给出交互原则和已在 Chrome 与 Googlebook 落地的入口,读者可据此评估指向式 AI 交互对现有提示词工作流的影响。

3月17日周二
  1. Mistral AI67

    Mistral 发布 Mistral Small 4,统一推理、多模态与编码能力并以 Apache 2.0 开源

    Mistral 发布 Mistral Small 4,是首个将 Magistral 推理、Pixtral 多模态和 Devstral 智能体编码能力统一到单一模型的小型旗舰,采用 Apache 2.0 许可开源。

    推荐理由:原文给出架构参数、reasoning_effort 用法和与 GPT-OSS 120B 的输出效率对比,读者可据此评估部署成本与选型。

3月12日周四
  1. Google Research62

    Google 在 Flood Hub 推出 AI 驱动的城市山洪预报,可提前 24 小时预测

    Google 宣布在 Flood Hub 上线 Urban Flash Flood 预报,用 AI 方法提前最多 24 小时预测城市山洪风险。其 Groundsource 方法用 Gemini 分析公开新闻报道构建历史山洪数据集,训练基于 LSTM 的 RNN 模型,仅依赖全球气象产品即可运行,空间分辨率 20x20 公里,覆盖人口密度大于每平方公里 100 人的城市区域。

    推荐理由:原文给出模型方法、精度数据和与 NWS 的对比,读者可了解 AI 山洪预报在缺监测地区的实际表现。

12月3日周三
3月7日周五
  1. Mistral AI62

    Mistral 发布 OCR API,主打复杂文档理解

    Mistral AI 发布光学字符识别 API Mistral OCR,接受图像和 PDF 输入,以有序的图文交错形式提取内容,定位为搭配 RAG 系统处理多模态文档的模型。

    推荐理由:官方给出完整基准对比、定价和部署选项,读者可以据此评估它在文档理解和 RAG 流程中的实际适用性。