Condé Nast 如何用 Amazon Bedrock 打造多模态视频发现系统
Condé Nast 与 AWS Generative AI Innovation Center 合作,基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频发现方案,采用 TwelveLabs Marengo 嵌入模型联合编码视觉、音频和文字稿信号,支持意图式语义搜索、图片查询和时间戳定位。
Condé Nast 与 AWS Generative AI Innovation Center 合作,基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频发现方案,采用 TwelveLabs Marengo 嵌入模型联合编码视觉、音频和文字稿信号,支持意图式语义搜索、图片查询和时间戳定位。
AWS 发布了一个合同智能平台参考架构,用 AI 智能体从合同 PDF 中提取 8 个关键字段并独立验证,解决 RAG 无法跨数百份合同做汇总查询的问题。提取由 Claude Sonnet 系列模型驱动,Claude Haiku 独立复核,签名分歧时由 Amazon Textract 做确定性裁定,结果存入 Amazon Aurora PostgreSQL。
AWS 这篇教程按组件讲解 Amazon Quick 的提示词技巧。Quick Research 需要明确研究目标、受众与范围,可拆解子问题并从 Quick Index。
AWS 发文讲解 Amazon Quick 的提示词工程基础原则与结构化框架,帮助用户让平台的 AI 功能更准确地响应自然语言请求。文章提出通过具体化、提供业务上下文、用示例(few-shot)示范输出格式等核心原则,并介绍 CRISPE 等通用框架。本文为系列第一篇,聚焦跨组件通用方法,第二篇将深入 Research、Flows、Sight、Chat Agents 等具体组件的技巧。
AWS 发布教程,讲解如何在 Amazon SageMaker AI 上通过 vLLM-Omni DLC 部署 Qwen3-TTS,实现语音生成完成前即可开始播放的流式语音输出。
在 Amazon SageMaker AI 上部署同一 AWS vLLM-Omni Deep Learning Container 的两个端点:实时端点运行 FLUX.2-klein-4B 生成图像,异步端点运行 Wan2.1-VACE-1.3B 将图像生成为视频,MP4 结果存入 Amazon S3。
AWS 通过 Amazon Nova Act 与 Amazon Bedrock AgentCore 构建智能体驱动的合成监控方案,用自然语言动作替代基于 DOM 选择器的 Selenium、Playwright 脚本。
Simon Willison 在 WeAreDevelopers World Congress North America 闭幕演讲中,用三张鸮鹦鹉照片和一段提示词让 Claude Opus 5.5 生成含 20 只以上鸮鹦鹉、带彩带和迪斯科球效果的像素艺术动画页面。
AWS 在 Amazon EKS 上结合 Elastic Fabric Adapter(EFA)和 DeepEP,构建了加速 MoE 模型大规模强化学习训练的架构,吞吐量提升 40%。
本文演示在 Amazon SageMaker HyperPod 上用开源 RL 框架 SkyRL 训练 Qwen3-VL-8B 视觉语言模型完成视觉迷宫导航任务。
AWS 的 NarrateAI 在 Amazon Bedrock 上通过五项技术为实时商业问答提供生产级 LLM 质量保障,实现约 99% 的数值准确率并实时流式输出响应。
Alibaba Cloud Qwen 团队开源的 Qwen3-TTS-12Hz-1.7B-Base 文本转语音模型现可通过 Amazon SageMaker JumpStart 部署到全托管实时推理端点。
Datacor 在其 TrackAbout 解决方案中集成 Amazon Quick Sight,为工业气体与焊接分销商提供租赁资产自助分析,客户无需再等待 IT 出报表,其客户合计管理 2750 万资产、每月超 72.5 万笔账单。
Amazon SageMaker HyperPod 与 Qumulo 的 Cloud Native Qumulo(CNQ)及 Cloud Data Fabric(CDF)结合,可让训练算力与数据集分别位于不同 AWS Region,无需复制数据即可跨区域读取。
Simon Willison 于 2026 年 9 月 24 日发布了 git 提交改写工具 commit-rewriter 的 0.2 版本。
GitHub Copilot 团队认为聊天不是与 AI 交互的正确界面,介绍了 GitHub Copilot app 中的 canvas 功能,它是可与应用内 agent 双向通信的全栈小程序。作者用 Connect 4 游戏、Winget 包管理、SQLite 操作和自动化开发工作流等示例说明,与其让 agent 处理每次交互浪费 token,不如让它构建一个后续交互免费的自定义工具。
GitHub Security Lab 的 Antonio Morales 发布 Fuzzing Taskflow,一个基于 Taskflow Agent 的自主模糊测试流水线,只需提供 GitHub 仓库即可自动识别入口点、编写 harness、运行 AFL++、改进覆盖并分诊崩溃。
推荐理由:原文详述了用 LLM Agent 自动写 harness、跑 AFL、追覆盖缺口和分诊崩溃的完整流水线设计,可直接复用。
AWS 发布 WhisperX 深度学习容器(DLC),在 OpenAI Whisper 基础上加入批处理推理、wav2vec2 强制对齐的词级时间戳和说话人分离,可在 SageMaker AI 上一键部署。
AWS 展示如何用 Amazon Bedrock AgentCore Gateway 和 MCP 构建多账户架构,让数据保留在各业务线(LOB)账户中,智能体通过统一端点跨账户发现和调用工具。
法律行业业务管理软件商 Aderant 基于 Amazon Bedrock 上的 Amazon Nova Lite 构建了智能工单分诊系统,自动化支持工单的上下文收集、分类与路由。
Hugging Face 与 NVIDIA 的教程演示如何将 SO-101 机械臂的 MuJoCo 拾放任务从 CPU 单世界迁移到最多 2,048 个并行 MJWarp GPU 环境。
AWS Machine Learning Blog 介绍了基于 Strands Agents SDK 构建的单个 AI 智能体方案,可在运行时自动编排 Amazon Bedrock、Amazon Rekognition 和 Amazon Transcribe,让用户用自然语言查询上传的视频内容。
OpenCode 是一个开源的终端原生 AI 编程智能体,用 Go 编写,可读取编辑文件、执行 shell 命令,并连接包括 Amazon Bedrock 在内的 75+ 家 LLM 提供商。
Latent Space 发布对 John Platt 的长篇访谈,介绍 Google 的 Empirical Research Assistance(ERA),用 Gemini 维护实验笔记本树并以类蒙特卡洛树搜索方式迭代变异,已产出至少十篇论文。访谈还讨论了用 AI 减少飞机凝聚尾迹(约占人为变暖 1%)、FireSat 卫星火灾监测,以及如何避免对评分函数的 Goodhart 式过拟合。
Simon Willison 发布 llm-keys-ui 0.1 插件,解决在 Codex Remote 远程控制机器时需要配置 API key 的问题。
OpenAI 将 Habitat 从一个 Python 库演进为全球分布式存储平台,服务超过 10 亿 ChatGPT 用户,支撑每秒 2200 万次请求。
GitHub Copilot app 新增内置 diff、terminal 和 browser 面板,让用户无需在编辑器、终端和浏览器之间切换即可审查、运行并预览智能体改动。
Hugging Face 在 TRL v1.14 的 AsyncGRPOTrainer 中加入 LoRA 支持(PR #7017),训练器与 vLLM 副本作为独立 HF Jobs 运行,仅几 MB 的 adapter 经 Storage Bucket 挂载同步,无需 NCCL。
推荐理由:原文给出完整的跨节点 LoRA 异步 RL 架构与五轮瓶颈调优数据,读者可以复用其中按 KV 前缀路由和 token 打包的调优方法。
GitHub 官方发布面向初学者的 GitHub Copilot app 教程,讲解如何同时运行多个智能体会话。每个会话可运行在独立的 Git worktree 中,互不干扰、各自保留上下文,用户可在会话视图中跟踪进度,把时间花在审查和决策而非等待上。
Hugging Face 发布完整教程,用 TRL 库的 GRPO 结合 LoRA 微调 LiquidAI/LFM2.5-350M,仅需约 500 样本和 100 步训练即可在免费级 Colab 或 Kaggle 16 GB GPU 上完成。
推荐理由:完整开源了小模型 GRPO 结构化输出微调的配方和评测对比,资源门槛低,方法可直接迁移到其他小模型任务。
Hugging Face 博客发布一篇开源复现:受 Surya Narreddi 病毒视频启发,作者用 TRL 和 OpenEnv 训练 Qwen/Qwen3.5-35B-A3B 通过 LoRA 写 p5.brush JavaScript 画水彩画,参考池、RL 环境、训练脚本和模型全部公开。
推荐理由:作者把审美偏好的RL复现完整开源,奖励设计、三组对照和踩坑修复都可迁移到类似的代码生成训练中。
Sentence Transformers v6.0 引入 MultiVectorEncoder 模型类型并配套完整训练流程,作者以医学检索为例演示如何微调 ColBERT 式多向量模型。
推荐理由:原文给出完整可复现的多向量模型微调配方,并用实验数据对比起点选择、训练开销和索引压缩,方法可直接迁移到自己的领域数据。
Hugging Face 撰文介绍 Papers with Code 复活后的混合搜索系统如何构建:以 PostgreSQL 全文检索加 pgvector 语义召回,经加权 RRF 融合排序。
IBM Research 在 Hugging Face Blog 发布 ALTK-Evolve 在 AppWorld 上跨八个模型的记忆校准研究,核心结论是智能体记忆不是开关而是按模型校准的剂量。
推荐理由:原文基于八个模型实测给出智能体记忆的剂量规律,弱模型靠精选检索、强模型用全集,兼顾精度与成本。
Hugging Face 发布教程介绍 Sentence Transformers v6.0 新增的 MultiVectorEncoder,PyLate、Stanford-NLP ColBERT 及 colpali-engine 检查点可直接加载。
推荐理由:官方详解 Sentence Transformers v6.0 新增多向量模型类型的用法,从原理、代价到索引和视觉文档检索都可落地操作。
Dharma AI 在 Hugging Face Blog 发布约束感知 GPU 分配器,与 FIFO 调度器在 7 个基准场景对比,GPU 利用率最高提升 33 个百分点,优先级加权产出平均提升 52%。该调度器将实时推理视为需求曲线而非峰值预留,批任务按优先级在 24 小时视野内规划,每次决策仅 1 至 15 毫秒,每个时间步只提交当前分配并每 30 至 60 分钟重跑以吸收预测误差。
Hugging Face 演示了 Strands Robots 中一个智能体如何完成机器人数据流闭环:从自然语言提示录制 LeRobotDataset 并同步到 Storage Buckets,训练时通过 stream_dataset 直接流式读取数据而无需下载,再以 mode="real" 一个关键字参数变更即可将 checkpoint 部署回硬件。
Hugging Face 复盘今年 7 月 15 日至 8 月 2 日举办的 ICML 2026 Open Reproductions 挑战赛:1,221 名社区成员用 Claude Code、Codex、Cursor 等智能体,19 天发布 6,816 份 Trackio 日志,尝试复现 2,226 篇论文,约占会议论文的 34%。
推荐理由:文中给出按声明逐条复核会议论文的结果分布和典型的证伪案例,读者可以借此理解智能体复现研究中人类角色的边界。
IBM Research 团队结合在 Agent 系统中构建路由的实践,提出模型路由本质是系统优化而非分类问题。
Hugging Face 博客发布 Profiling in PyTorch 系列第三篇,用 profiler 分析注意力机制从朴素实现到 SDPA 各后端的表现。
推荐理由:文章用 profiler 逐一对注意力各实现读 trace,给出 kernel 数、耗时与占用率等一手数据,方法可直接迁移到自己的模型调优。