在 SageMaker AI 上用 vLLM-Omni 生成图像与视频 – 第二部分
在 Amazon SageMaker AI 上部署同一 AWS vLLM-Omni Deep Learning Container 的两个端点:实时端点运行 FLUX.2-klein-4B 生成图像,异步端点运行 Wan2.1-VACE-1.3B 将图像生成为视频,MP4 结果存入 Amazon S3。
在 Amazon SageMaker AI 上部署同一 AWS vLLM-Omni Deep Learning Container 的两个端点:实时端点运行 FLUX.2-klein-4B 生成图像,异步端点运行 Wan2.1-VACE-1.3B 将图像生成为视频,MP4 结果存入 Amazon S3。
Runway 本月早些时候发布研究预览版 GWM Worlds 2,将高保真视频与音频生成变为实时交互模拟,并推出 WorldPrompt 这一输入格式,可固定模拟环境并创建带时间戳的事件。
Google Research 推出 AI 视频联合导演研究,基于 Gemini 和 Veo 构建统一多智能体框架,包含 Co-Director、CANVAS、A²RD 和 VQQA 四套框架,将长视频生成建模为全局优化与世界状态跟踪问题。
invideo 借助 GPT‑6 Astra 更精确地规划视频剪辑,将调色效率提升 3 倍,并能在一天内产出 50 个自定义特效。
Higgsfield AI 利用 GPT-6 Astra,在一天内推出了新的视频功能。这些功能让小型企业更轻松地制作视频广告,并加速新创意工具的上市速度。
Google DeepMind 推出 Gemini Omni 1.1 Flash,通过 Gemini API 在 Google AI Studio 提供面向专业制作的生成视频能力。
推荐理由:官方公告给出了每项视频控制能力的具体参数与使用入口,开发者可据此评估是否接入现有生成视频工作流。
NVIDIA 发布 Cosmos-H-Dreams,一个面向手术机器人的实时、动作条件生成式仿真器,将 Cosmos-H-Surgical-Simulator 蒸馏为因果少步学生模型,并通过 FlashDreams 推理库在单张 NVIDIA RTX PRO 6000 上实现约 160 fps 的交互式运行。
Google DeepMind 发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image),4 秒生成 1K 图像、每张 $0.034,上线 Google AI Studio、Gemini API 等平台。
推荐理由:官方给出两款新模型的价格、延迟和限制等具体参数,开发者可以据此评估替换现有模型的成本收益。
Google DeepMind 发布 Gemini Omni 系列首个模型 Gemini Omni Flash,可结合图像、音频、视频和文本输入生成高质量视频,并支持通过自然语言多轮编辑。
推荐理由:官方公告说明了 Gemini Omni Flash 的视频生成与对话式编辑能力、可用入口和订阅范围,读者可据此判断它如何改变创作流程。