Condé Nast 如何用 Amazon Bedrock 打造多模态视频发现系统
Condé Nast 与 AWS Generative AI Innovation Center 合作,基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频发现方案,采用 TwelveLabs Marengo 嵌入模型联合编码视觉、音频和文字稿信号,支持意图式语义搜索、图片查询和时间戳定位。
Condé Nast 与 AWS Generative AI Innovation Center 合作,基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频发现方案,采用 TwelveLabs Marengo 嵌入模型联合编码视觉、音频和文字稿信号,支持意图式语义搜索、图片查询和时间戳定位。
Microsoft Research 发布 Quine,一个包含生物学世界模型和交互式 harness 的 AI 研究系统,可跨基因组、蛋白质、化学、细胞状态和生物成像等模态联合学习。
Microsoft Research Asia – Singapore 于 2025 年 7 月 24 日成立,是 Microsoft 在东南亚的首个研究实验室。
在 Amazon SageMaker AI 上部署同一 AWS vLLM-Omni Deep Learning Container 的两个端点:实时端点运行 FLUX.2-klein-4B 生成图像,异步端点运行 Wan2.1-VACE-1.3B 将图像生成为视频,MP4 结果存入 Amazon S3。
AWS 通过 Amazon Nova Act 与 Amazon Bedrock AgentCore 构建智能体驱动的合成监控方案,用自然语言动作替代基于 DOM 选择器的 Selenium、Playwright 脚本。
本文演示在 Amazon SageMaker HyperPod 上用开源 RL 框架 SkyRL 训练 Qwen3-VL-8B 视觉语言模型完成视觉迷宫导航任务。
Google Research 推出 AI 视频联合导演研究,基于 Gemini 和 Veo 构建统一多智能体框架,包含 Co-Director、CANVAS、A²RD 和 VQQA 四套框架,将长视频生成建模为全局优化与世界状态跟踪问题。
Google DeepMind 在 Gemini 3.8 Live 发布一周后推出 Live Avatar 功能,为对话模型带来近实时的视频形象。
Liquid AI 为视觉语言模型 LFM2.5-VL-3B 发布实验性 DSpark 草稿模型,通过投机解码在不改变输出质量的前提下加速推理。解码最高提速 3.13x(M5 Max 端侧)和 2.66x(H100),端到端最高提升 2.62x 和 2.27x;草稿模型增加 280M 参数(约 8.9%),首日支持 llama.cpp、MLX-VLM 和 SGLang。
推荐理由:原文给出视觉语言模型投机解码加速的具体数字、内存开销和第一天框架支持,读者可以据此评估端侧与 GPU 部署收益。
AWS Machine Learning Blog 介绍了基于 Strands Agents SDK 构建的单个 AI 智能体方案,可在运行时自动编排 Amazon Bedrock、Amazon Rekognition 和 Amazon Transcribe,让用户用自然语言查询上传的视频内容。
9月22-23日,NVIDIA 在新加坡 AI Day 上与合作伙伴展示东南亚地区的 AI 进展。新加坡 HTX 基于 Nemotron 3 Super 和 Nemotron 3 Nano Omni 推进公共安全 AI 研究。
Higgsfield AI 利用 GPT-6 Astra,在一天内推出了新的视频功能。这些功能让小型企业更轻松地制作视频广告,并加速新创意工具的上市速度。
Google Research 发布新研究实验,让教育者借助生成式 UI(GenUI)动态生成符合教学目标的定制化互动学习模拟。目前已开放超过 30 个覆盖物理、化学、生物和数学的英语 STEM 学习互动样本,面向初高中,均由 AI 生成并经教师审核。
曼彻斯特大学与 NVIDIA 合作,将 Earth-2 CorrDiff 生成式降尺度模型用于全英空气污染预测,在英国国家 AI 超算 Isambard-AI 上用一年逐小时污染数据训练,仅 2 天即在单个 8-GPU 节点上完成,生成 2-3 平方公里分辨率的全英污染模型。
Google Research 与 HHMI Janelia、MRC 分子生物学实验室及剑桥大学等合作,在 Cell 发表雄性果蝇大脑与中枢神经系统的完整连接组,包含超过 166,000 个神经元和 1.25 亿个突触连接,是目前按神经元数量计最大的大脑图谱。
推荐理由:官方团队说明了这份连接组图谱的规模、验证方式和可视化工具,读者可以了解它与雌性图谱互补后的研究用途。
Google DeepMind 与 Google Research 发布 WeatherNext 3,官方称其为迄今最先进准确的全球天气 AI 模型。
推荐理由:原文给出分辨率、更新频率和降水准确率等具体指标,并说明如何接入 Google 产品与数据平台,可据此评估应用场景。
Hugging Face 推出 NeoMME 多语言多模态编码器家族,含 260M 和 800M 两个规模,用单个双向 Transformer 从头处理文本 token 和原始图像 patch,无需单独的预训练视觉塔或因果语言模型。
Google 与 NASA JPL 在 PNAS 发表 MAPL-EMIT,一个基于 Swin-S vision transformer 的深度学习框架,用 EMIT 高光谱数据自动检测、量化并定位全球甲烷羽流。
Google DeepMind 发布 agentic video understanding 功能,覆盖 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite,通过智能体循环动态搜索和检视视频片段,替代固定帧率的静态处理。
推荐理由:官方公布了具体降本增效数字和 API 启用方式,开发者可据此评估长视频分析的成本与精度取舍。
Microsoft Research 推出 GigaPath-Flash 和 GigaTIME-Flash 研究模型,以大幅提升病理学研究的计算效率。
Google DeepMind 推出 Gemini Omni 1.1 Flash,通过 Gemini API 在 Google AI Studio 提供面向专业制作的生成视频能力。
推荐理由:官方公告给出了每项视频控制能力的具体参数与使用入口,开发者可据此评估是否接入现有生成视频工作流。
Google DeepMind 推出 Gemini 3.5 Transcribe,定位为其最精准的实时语音转写模型,可清理语气词、自动格式化并识别自定义词表。
推荐理由:官方发布带具体 WER、延迟和 API 形态,开发者可据此评估语音转写与语音交互方案的选型。
Google 在 CHI 2026 发表 AgentHands,一个让 XR 中 AI 智能体生成与语音同步的 3D 手部手势的研究原型。系统由环境感知、手势事件库、手势嵌入推理和同步 XR 执行四个模块组成,将 LLM 输出映射为精准的空间动作。在 12 人被试内实验中,与纯语音基线相比,该手势显著提升了空间指代与交互效果。
Google Research 推出 Mobility-Embedded POIs(ME-POIs)框架,将聚合、匿名的出行模式融入 Gemini 等语言模型生成的地点表示,捕捉 POI 的时间活动节奏。
Google Research 提出 PhotoScan,一个研究性质的深度学习框架,可从普通 2D 智能手机照片估计体脂率(BF%)、Android-to-Gynoid 脂肪比(A/G)和内脏-皮下脂肪比(V/S)等三维身体成分指标。
Hugging Face 的 OlmoEarth Studio 现已支持计算并导出开源 OlmoEarth 基础模型的 embedding 向量,用于相似性搜索、少样本分割等下游任务。
Microsoft Research 发布 MindTopo 基准,评估多模态大语言模型对连续性、分离、顺序、封闭和绳结五类拓扑概念的理解,涵盖静态推理与交互规划两个层级。测试显示,专有与开源模型在静态识别上明显优于交互式规划任务,且均远低于人类水平,错误多出现在规划阶段丢失结构关系。图像与视频生成工具仅在单帧内偶尔有帮助,难以在多步操作中保持拓扑约束。
Google DeepMind 发布多语言手语转文本(SL2T)模型,为 Gboard 和 Live Transcribe 带来手语转文字输入,率先支持 Pixel 11 上的 ASL 转英语。
推荐理由:官方说明模型训练规模、基准成绩和隐私设计,读者可了解手语翻译落地的技术路径与现存限制。
Google Research 推出 AMIE (Video),基于 Gemini 和 Project Astra 的实时视频临床问诊系统,采用 Talker、Planner、Perception 三个并行智能体的异步架构。
推荐理由:原文给出多智能体架构设计与大规模随机对照评估结果,读者可以了解实时音视频临床 AI 的实现路径与现有局限。
微软研究院发布研究模型 CARE-X,一个统一的胸部 X 光 VLM,结合生成式与判别式双推理,支持报告生成、疾病定位、多标签分类等多样临床解读任务。该模型采用 DAPO 强化学习在多任务设置中奖励临床正确性,并在 Narayana Health 的真实印度临床数据上验证。另一项独立实验将 Qwen3-VL-4B-Instruct 与确定性测量工具配对,评估直接计算能否提升测量依赖病灶的表现。
NVIDIA 发布 Magpie TTS Multilingual 开放权重模型,参数量 364M,新增现代标准阿拉伯语、韩语和巴西葡萄牙语,共支持 12 种语言,并提供生产级 NIM 部署容器。
推荐理由:原文给出TTFA延迟数据和架构改进细节,读者可据此评估自部署级联语音方案相对一体化语音模型的取舍。
Meta 于今日发布 Muse Glimmer,一个从 Muse 蒸馏而来的 30B 多模态开源模型,采用 Apache 2.0 许可,面向本地隐私敏感的 Agentic 场景如编码、文档分析和个人助手。
推荐理由:官方介绍可帮助读者了解这个 30B 本地多模态模型在 Agentic 基准上的表现与本地部署路径。
Mistral 发布 3B 开源权重多模态安全分类器 Shieldstral,将内容审核建模为策略自适应的问答任务,在推理时接受自然语言策略并输出校准的安全分数。该模型在文本安全上匹敌最大 7 倍于其体量的开放护栏模型,在多模态审核上创造新 SOTA,以 Apache 2.0 协议开放权重,可在单张 16GB GPU 上运行。
推荐理由:原文给出把内容审核改写成策略自适应问答的建模思路和数据构建方法,对做安全分类器的团队有可迁移的参考价值。
Google DeepMind 发布具身推理模型 Gemini Robotics ER 2,作为机器人的高层大脑,可编排多步任务并把执行交给 VLA 模型或其他底层控制接口。
推荐理由:官方公布了视频理解、任务编排和多机器人协作等具体能力与基准数字,可据此了解具身推理模型的进展方向。
Google DeepMind 发布三款新 Gemini 模型:3.6 Flash 在 Artificial Analysis Index 上比 3.5 Flash 少输出 17% token。
推荐理由:官方给出三个新 Flash 模型的效率数据和定价,并披露 Gemini 4 预训练已启动,读者可据此评估升级选择。
DharmaOCR 在巴西葡萄牙语 OCR 基准上以 0.925 的得分领先新模型 Mistral OCR4(0.798)和 Unlimited-OCR(0.7587),证明领域专精的优势依然成立。该模型先通过葡萄牙语文档监督微调对齐词汇与文档结构,再用 DPO 从偏好数据中学习以降低输出退化率和推理成本。专项化训练使全部参数集中于单一语言,这一结构性取舍构成了对多语言模型的可量化优势。
Thinking Machines 在 Hugging Face 发布开源多模态模型 Inkling,总计 975B 参数、激活 41B 的 MoE 架构,原生接受图像、文本和音频输入,支持 1M 上下文,训练数据为 45 万亿 token。
推荐理由:原文给出 Inkling 与 Inkling-Small 的架构细节、部署配置和多份基准数字,可帮助读者评估其在多模态推理场景的可用性。
Google DeepMind 与印度 Atal Innovation Mission 合作推出 ATL Saathi 试点,这是一款基于 Gemini 的教师助手应用,服务覆盖 1100 万学生创新实验室。
Photoroom 发布 PRX 系列博客第 4 篇,公开 7B 文生图模型的预训练数据管线:混合公开与内部数据集,用 VLM 重标注全部图片,转成 MDS 流式语料。
Google Research 发布覆盖 50 多个全球城市的建筑级屋顶反照率数据集,并通过新的高分辨率 Heat Resilience Earth Engine App 开放访问。