在 SageMaker AI 上用 WhisperX 实现带说话人标注的语音转写
AWS 发布 WhisperX 深度学习容器(DLC),在 OpenAI Whisper 基础上加入批处理推理、wav2vec2 强制对齐的词级时间戳和说话人分离,可在 SageMaker AI 上一键部署。
AWS 发布 WhisperX 深度学习容器(DLC),在 OpenAI Whisper 基础上加入批处理推理、wav2vec2 强制对齐的词级时间戳和说话人分离,可在 SageMaker AI 上一键部署。
AWS 展示如何用 Amazon Bedrock AgentCore Gateway 和 MCP 构建多账户架构,让数据保留在各业务线(LOB)账户中,智能体通过统一端点跨账户发现和调用工具。
法律行业业务管理软件商 Aderant 基于 Amazon Bedrock 上的 Amazon Nova Lite 构建了智能工单分诊系统,自动化支持工单的上下文收集、分类与路由。
Liquid AI 为视觉语言模型 LFM2.5-VL-3B 发布实验性 DSpark 草稿模型,通过投机解码在不改变输出质量的前提下加速推理。解码最高提速 3.13x(M5 Max 端侧)和 2.66x(H100),端到端最高提升 2.62x 和 2.27x;草稿模型增加 280M 参数(约 8.9%),首日支持 llama.cpp、MLX-VLM 和 SGLang。
推荐理由:原文给出视觉语言模型投机解码加速的具体数字、内存开销和第一天框架支持,读者可以据此评估端侧与 GPU 部署收益。
Remedy Entertainment 的 CONTROL Resonant 上线即登陆 GeForce NOW,玩家可云端畅玩 Dylan Faden 在扭曲曼哈顿对抗 Hiss 的故事。
Hugging Face 与 NVIDIA 的教程演示如何将 SO-101 机械臂的 MuJoCo 拾放任务从 CPU 单世界迁移到最多 2,048 个并行 MJWarp GPU 环境。
GitHub Copilot 应用重构了 Pull Request 视图,可流畅渲染一个含 2,200 个文件、超一百万行变更、400 多条行内评论的开源巨型 PR。核心做法是把高度拆成确定性的代码几何与按需测量的动态评论块几何,配合滚动锚定校正、空闲调度测量,以及无人值守的变更到测量到改进循环来定位 bug。
推荐理由:原文完整拆解了超大 PR 渲染的双几何设计与自动化测量方法,工程细节可直接迁移到类似虚拟化场景。
AWS Machine Learning Blog 介绍了基于 Strands Agents SDK 构建的单个 AI 智能体方案,可在运行时自动编排 Amazon Bedrock、Amazon Rekognition 和 Amazon Transcribe,让用户用自然语言查询上传的视频内容。
OpenCode 是一个开源的终端原生 AI 编程智能体,用 Go 编写,可读取编辑文件、执行 shell 命令,并连接包括 Amazon Bedrock 在内的 75+ 家 LLM 提供商。
Microsoft Research 通过系统性测量研究指出,仅依赖机器人机载 GPU 会限制性能、续航与可扩展性。实验显示小型 GPU 上地图与规划最高慢 383%,导航障碍及时检测率下降 30%,VLA 模型准确率下降 50%;换成 Raspberry Pi-5 并卸载推理可显著延长电池时间,Jetson Thor 等机载 GPU 对机器人的电池消耗高达 160%。
OpenAI Academy 迎来两周年,OpenAI 表示将继续把 AI 技能带给更多社区。该项目两年来面向公众推广 AI 技能教育,未来计划覆盖更广泛的人群。
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,覆盖 100 多种语言和方言,支持从 30 秒音频样本复刻声音、逐行导演表演节奏以及原生双说话人场景编排。
推荐理由:官方发布说明了两个 TTS 模型的定位、评测成绩和语音设计能力,开发者可以直接对照评测与入口评估是否接入。
NVIDIA 验证工程师 Sakeena Fiza 负责在大规模量产前发现数据中心硬件缺陷,她曾见证 NVIDIA Rubin GPU 首次在系统级成功枚举。验证工作贯穿从单板、整机架到 AI 工厂的各个环节,一块单板可能包含数万个元器件,一个机架接近 50 万个,团队需要排查高速信号、散热余量、电源完整性等各类失效原因。
OpenAI 宣布将 Daybreak 项目的访问权限扩展至乌克兰政府,用于支持民用基础设施的网络防御。
Harvey 利用 GPT-6 Astra 生成更具结构性、更贴合上下文的法律文件,让律师能够专注于策略工作。
invideo 借助 GPT‑6 Astra 更精确地规划视频剪辑,将调色效率提升 3 倍,并能在一天内产出 50 个自定义特效。
客服公司 Ringg 采用 GPT-5.6 驱动其 AI 智能体,最多可自动解决 65% 的客户来电。这些智能体覆盖语音、聊天、WhatsApp 和网页等多语言渠道,成本相比使用 GPT-4.1 降低 90%。
OpenAI CEO Sam Altman 在联合国安理会发言,讨论 AI 安全、人类控制和国际合作议题。
OpenAI 推出 MentalHealthBench,这是一个由专家参与构建的基准,用于评估 AI 在真实心理健康对话场景中回应的有用性与安全性。
9月22-23日,NVIDIA 在新加坡 AI Day 上与合作伙伴展示东南亚地区的 AI 进展。新加坡 HTX 基于 Nemotron 3 Super 和 Nemotron 3 Nano Omni 推进公共安全 AI 研究。
ChatGPT Ads 扩展至东南亚和台湾,为符合条件的商家提供新的触达用户方式。此次扩展后该广告服务覆盖超过 60 个国家和地区。
Airbnb 扩大了员工对 GPT-6 Astra 和 OpenAI 前沿模型的访问,帮助工程团队排查 bug、设计系统并加快交付速度。此举使更多工程团队得以借助这些模型提升开发效率。
OpenAI 与 Grab 推出区域项目 "GO Forward with AI",帮助东南亚 30,000 名合作伙伴掌握实用 AI 技能。该项目覆盖整个东南亚地区,聚焦实践性 AI 能力培训。
OpenAI 介绍了 GPT-6 在提示词缓存方面的改进,包括更高的缓存命中率、新的诊断功能、显式断点以及更多控制选项。这些能力可降低延迟和成本。
OpenAI 的 GPT-6 Sol 和 GPT-6 Luna 在 Amazon Bedrock 正式可用,API 定价显著低于 GPT-5.6 前代。GPT-6 Sol 面向推理、编码和多步骤复杂任务,内部事实性评估中事实错误约为 GPT-5.6 Sol 的一半;GPT-6 Luna 面向大规模重复性任务,支持按请求调整推理力度。
推荐理由:原文给出两款模型的定位差异、定价变化与数据管控细节,读者可以据此为不同负载选型和评估上云方式。
OpenAI 发布 GPT-6 Sol 和 Luna 两个模型,将前沿智能带入日常工作,两者在能力与成本之间提供不同的平衡。
推荐理由:官方宣布 GPT-6 Sol 和 Luna 两个模型,定位在能力与成本间做不同取舍,可关注两者的差异化定位。
AWS 宣布 Claude Opus 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上可用,是 Claude 5.5 系列首个模型。
推荐理由:原文给出 Claude Opus 5.5 相比 Opus 5 的成本、沟通和安全性变化,以及在 Amazon Bedrock 上从控制台到多种 API 的具体接入方法。
NVIDIA 在多伦多 ROSCon 大会上发布 Isaac ROS 5.0,为约 130 万 ROS 用户带来智能体化工作流与平台支持。新版本支持 ROS Lyrical 和 Ubuntu 24.04,新增 FoundationStereo 微调技能与 Agent 就绪文档,FoundationPose 推理库使物体位姿追踪速度提升 5.5x。
OpenAI 的 GPT-6 Astra 帮助 Parallel 的智能体研究和整合劳动力市场数据,与此前模型相比用时和成本均减半。
Hugging Face 宣布 transformers 新增 GGUF 模型运行支持,通过 from_pretrained 传入 gguf_file 即可加载 Hub 上的量化 checkpoint,在 Apple Silicon 上本地生成。
推荐理由:官方给出了从加载、量化选择到与 llama.cpp 对比的完整路径,读者可以直接上手在 Mac 本地跑 GGUF。
UK AI Security Institute(AISI)开始使用 EvalEval 的基础设施公开发布评测结果,推动评测科学更可复现、可验证。
OpenAI 阐述了针对前沿模型及其安全防护措施开展严格、安全且独立的第三方 AI 安全评估的重点与原则。该框架旨在指导第三方评估的有效实施,提升前沿模型安全评估的规范性与可信度。
Hugging Face 宣布 oMLX 创建者和维护者 Jun Kim 加入团队,支持 Apple Silicon 本地 AI 框架 MLX 的社区生态。oMLX 将从副业项目转为获得持续资助的项目,继续保持 Apache 2.0 开源并由 Jun 领导。
NVIDIA 推出 DSX Ready 认证计划,为符合 NVIDIA DSX AI 工厂参考设计要求的合作伙伴产品和解决方案提供资格认证。
NVIDIA 在大埃及博物馆举办活动,展示埃及 AI 生态进入生产级规模:Deep Learning Institute 学员一年内增长逾十倍,Hassan Allam 与 A15 将投资约 4 亿美元新建数据中心。非洲一年内已宣布或上线四座 AI 工厂,另有 656 兆瓦在建产能;NVIDIA 已培训逾 85,000 名非洲开发者,尼日利亚成为其全球第二大市场。
Microsoft Research 在 Nature 发表逆合成预测框架 RetroChimera,并开源实现和权重(MIT 许可,GitHub 和 Microsoft Foundry 可用)。模型由 R-SMILES 2 和 NeuralLoc 两个子模型通过 learning-to-rank 集成,盲测中 PhD 级化学家更偏好其单步预测,10 个挑战性目标中完成 9 个,优于子模型和基线。
NVIDIA 发文提出 AI 安全是工程问题,需要明确需求、可执行控制、指定责任人和防护有效性的证据。文章主张安全取决于模型、harness 和运行时构成的完整智能体栈,介绍开源安全运行时 NVIDIA OpenShell 及 Cisco DefenseClaw、JFrog 集成等生态实践,并强调重大变更后需重复测试、由责任人决定是否部署。
Multiverse 的最新论文将 LLM 深度剪枝中的 block 选择问题重构为约束二元优化(CBO),直接映射到 Ising glass 自旋系统,能量值成为剪枝后模型 benchmark 表现的廉价代理指标。
Higgsfield AI 利用 GPT-6 Astra,在一天内推出了新的视频功能。这些功能让小型企业更轻松地制作视频广告,并加速新创意工具的上市速度。
OpenAI 正与一个独立的“数学与人工智能咨询小组”(Advisory Group on Mathematics and Artificial Intelligence)合作,为新兴 AI 研究结果的审查与对外沟通提供指导。该小组独立运作,帮助 OpenAI 评估和传达相关领域的新进展。