Anthropic Claude Opus 5 与 Claude Sonnet 5 登陆 Amazon Bedrock,首尔和新加坡区域提供区域内推理
Amazon Bedrock 现已在首尔区域(ap-northeast-2)支持 Claude Opus 5 和 Claude Sonnet 5、在新加坡区域(ap-southeast-1)支持 Claude Sonnet 5 的区域内推理。
Amazon Bedrock 现已在首尔区域(ap-northeast-2)支持 Claude Opus 5 和 Claude Sonnet 5、在新加坡区域(ap-southeast-1)支持 Claude Sonnet 5 的区域内推理。
Amazon Bedrock 宣布在印度地区提供 Anthropic 的 Claude Opus 5、Claude Sonnet 5 和 Claude Haiku 4.5,通过地理跨区域推理在 Mumbai 和 Hyderabad 两个 Region(ap-south-1 和 ap-south-2)内处理数据。
AWS 发布了一个合同智能平台参考架构,用 AI 智能体从合同 PDF 中提取 8 个关键字段并独立验证,解决 RAG 无法跨数百份合同做汇总查询的问题。提取由 Claude Sonnet 系列模型驱动,Claude Haiku 独立复核,签名分歧时由 Amazon Textract 做确定性裁定,结果存入 Amazon Aurora PostgreSQL。
AWS 这篇教程按组件讲解 Amazon Quick 的提示词技巧。Quick Research 需要明确研究目标、受众与范围,可拆解子问题并从 Quick Index。
xAI 的 Grok 4.7 上线 Amazon Bedrock,提供 500K token 上下文窗口和 low 到 xhigh 四档推理力度,通过 us.xai.grok-4.7 和 global.xai.grok-4.7 跨区域推理配置接入,支持 Responses、Chat Completions 和 Converse API。
推荐理由:原文给出 Bedrock 上的接入方式、推理档位与 Artificial Analysis 独立评测数据,可帮助读者评估成本与接入取舍。
AWS 宣布 Claude Sonnet 5.5 可在 Amazon Bedrock 和 Claude Platform on AWS 使用,主打专注编码与知识工作,多数任务单次成本更低、速度更快。
推荐理由:原文给出 Sonnet 5.5 在 Bedrock 的能力变化、与 Opus 5.5 的分工建议和接入步骤,可据此规划工程工作流。
AWS 发布教程,讲解如何在 Amazon SageMaker AI 上通过 vLLM-Omni DLC 部署 Qwen3-TTS,实现语音生成完成前即可开始播放的流式语音输出。
在 Amazon SageMaker AI 上部署同一 AWS vLLM-Omni Deep Learning Container 的两个端点:实时端点运行 FLUX.2-klein-4B 生成图像,异步端点运行 Wan2.1-VACE-1.3B 将图像生成为视频,MP4 结果存入 Amazon S3。
Mistral 宣布在慕尼黑开设新枢纽,设立专注 Physics AI 和工业 AI 的研究团队与应用工程团队。2026 年 5 月收购 Emmi AI 后超过 30 名物理与工程 AI 人员加入;正与 BMW 合作碰撞仿真、与 Siemens Energy 合作工业 AI 应用,并与慕尼黑工业大学利用风洞设施研发汽车空气动力学数字孪生。
本文介绍 Amazon Textract Custom Queries adapter 跨账号生命周期管理方案,提供 AWS CloudFormation 和 Terraform 基础设施模板及晋级流程。
AWS 在 Amazon EKS 上结合 Elastic Fabric Adapter(EFA)和 DeepEP,构建了加速 MoE 模型大规模强化学习训练的架构,吞吐量提升 40%。
本文演示在 Amazon SageMaker HyperPod 上用开源 RL 框架 SkyRL 训练 Qwen3-VL-8B 视觉语言模型完成视觉迷宫导航任务。
AWS 的 NarrateAI 在 Amazon Bedrock 上通过五项技术为实时商业问答提供生产级 LLM 质量保障,实现约 99% 的数值准确率并实时流式输出响应。
Alibaba Cloud Qwen 团队开源的 Qwen3-TTS-12Hz-1.7B-Base 文本转语音模型现可通过 Amazon SageMaker JumpStart 部署到全托管实时推理端点。
Datacor 在其 TrackAbout 解决方案中集成 Amazon Quick Sight,为工业气体与焊接分销商提供租赁资产自助分析,客户无需再等待 IT 出报表,其客户合计管理 2750 万资产、每月超 72.5 万笔账单。
Amazon SageMaker HyperPod 与 Qumulo 的 Cloud Native Qumulo(CNQ)及 Cloud Data Fabric(CDF)结合,可让训练算力与数据集分别位于不同 AWS Region,无需复制数据即可跨区域读取。
AWS 发布 WhisperX 深度学习容器(DLC),在 OpenAI Whisper 基础上加入批处理推理、wav2vec2 强制对齐的词级时间戳和说话人分离,可在 SageMaker AI 上一键部署。
AWS 展示如何用 Amazon Bedrock AgentCore Gateway 和 MCP 构建多账户架构,让数据保留在各业务线(LOB)账户中,智能体通过统一端点跨账户发现和调用工具。
法律行业业务管理软件商 Aderant 基于 Amazon Bedrock 上的 Amazon Nova Lite 构建了智能工单分诊系统,自动化支持工单的上下文收集、分类与路由。
Hugging Face 与 NVIDIA 的教程演示如何将 SO-101 机械臂的 MuJoCo 拾放任务从 CPU 单世界迁移到最多 2,048 个并行 MJWarp GPU 环境。
GitHub Copilot 应用重构了 Pull Request 视图,可流畅渲染一个含 2,200 个文件、超一百万行变更、400 多条行内评论的开源巨型 PR。核心做法是把高度拆成确定性的代码几何与按需测量的动态评论块几何,配合滚动锚定校正、空闲调度测量,以及无人值守的变更到测量到改进循环来定位 bug。
推荐理由:原文完整拆解了超大 PR 渲染的双几何设计与自动化测量方法,工程细节可直接迁移到类似虚拟化场景。
AWS Machine Learning Blog 介绍了基于 Strands Agents SDK 构建的单个 AI 智能体方案,可在运行时自动编排 Amazon Bedrock、Amazon Rekognition 和 Amazon Transcribe,让用户用自然语言查询上传的视频内容。
OpenCode 是一个开源的终端原生 AI 编程智能体,用 Go 编写,可读取编辑文件、执行 shell 命令,并连接包括 Amazon Bedrock 在内的 75+ 家 LLM 提供商。
Microsoft Research 通过系统性测量研究指出,仅依赖机器人机载 GPU 会限制性能、续航与可扩展性。实验显示小型 GPU 上地图与规划最高慢 383%,导航障碍及时检测率下降 30%,VLA 模型准确率下降 50%;换成 Raspberry Pi-5 并卸载推理可显著延长电池时间,Jetson Thor 等机载 GPU 对机器人的电池消耗高达 160%。
NVIDIA 验证工程师 Sakeena Fiza 负责在大规模量产前发现数据中心硬件缺陷,她曾见证 NVIDIA Rubin GPU 首次在系统级成功枚举。验证工作贯穿从单板、整机架到 AI 工厂的各个环节,一块单板可能包含数万个元器件,一个机架接近 50 万个,团队需要排查高速信号、散热余量、电源完整性等各类失效原因。
OpenAI 介绍了 GPT-6 在提示词缓存方面的改进,包括更高的缓存命中率、新的诊断功能、显式断点以及更多控制选项。这些能力可降低延迟和成本。
OpenAI 的 GPT-6 Sol 和 GPT-6 Luna 在 Amazon Bedrock 正式可用,API 定价显著低于 GPT-5.6 前代。GPT-6 Sol 面向推理、编码和多步骤复杂任务,内部事实性评估中事实错误约为 GPT-5.6 Sol 的一半;GPT-6 Luna 面向大规模重复性任务,支持按请求调整推理力度。
推荐理由:原文给出两款模型的定位差异、定价变化与数据管控细节,读者可以据此为不同负载选型和评估上云方式。
AWS 宣布 Claude Opus 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上可用,是 Claude 5.5 系列首个模型。
推荐理由:原文给出 Claude Opus 5.5 相比 Opus 5 的成本、沟通和安全性变化,以及在 Amazon Bedrock 上从控制台到多种 API 的具体接入方法。
Hugging Face 宣布 transformers 新增 GGUF 模型运行支持,通过 from_pretrained 传入 gguf_file 即可加载 Hub 上的量化 checkpoint,在 Apple Silicon 上本地生成。
推荐理由:官方给出了从加载、量化选择到与 llama.cpp 对比的完整路径,读者可以直接上手在 Mac 本地跑 GGUF。
NVIDIA 推出 DSX Ready 认证计划,为符合 NVIDIA DSX AI 工厂参考设计要求的合作伙伴产品和解决方案提供资格认证。
NVIDIA 在大埃及博物馆举办活动,展示埃及 AI 生态进入生产级规模:Deep Learning Institute 学员一年内增长逾十倍,Hassan Allam 与 A15 将投资约 4 亿美元新建数据中心。非洲一年内已宣布或上线四座 AI 工厂,另有 656 兆瓦在建产能;NVIDIA 已培训逾 85,000 名非洲开发者,尼日利亚成为其全球第二大市场。
Microsoft Research 在 Nature 发表逆合成预测框架 RetroChimera,并开源实现和权重(MIT 许可,GitHub 和 Microsoft Foundry 可用)。模型由 R-SMILES 2 和 NeuralLoc 两个子模型通过 learning-to-rank 集成,盲测中 PhD 级化学家更偏好其单步预测,10 个挑战性目标中完成 9 个,优于子模型和基线。
Multiverse 的最新论文将 LLM 深度剪枝中的 block 选择问题重构为约束二元优化(CBO),直接映射到 Ising glass 自旋系统,能量值成为剪枝后模型 benchmark 表现的廉价代理指标。
GitHub 用 AI 智能体将 Copilot 智能体运行时完整重写为超过 800,000 行生产 Rust,通过 128 个 pull request 增量合入 main 并逐步发布,于 2026 年 8 月 21 日达成 100% Rust。
推荐理由:作者亲历复盘用 AI 智能体将 Copilot 运行时从 TypeScript 迁移到 80 万行 Rust 的过程,给出可迁移的增量迁移、提示词缓存与多会话协作方法。
NVIDIA Vera Rubin NVL72 首次提交 MLPerf Inference v6.1 预览成绩,在 Qwen3-VL 上吞吐最高达 GB300 NVL72 的 3.7x,在 DeepSeek-R1 上达 2.5x,使用 vLLM、Dynamo 和 TensorRT-LLM。
Emerald AI、Google 与 NVIDIA 宣布成立 AI Energy Management Alliance(AEMA),推动数据中心根据电网状况动态调整用电。
曼彻斯特大学与 NVIDIA 合作,将 Earth-2 CorrDiff 生成式降尺度模型用于全英空气污染预测,在英国国家 AI 超算 Isambard-AI 上用一年逐小时污染数据训练,仅 2 天即在单个 8-GPU 节点上完成,生成 2-3 平方公里分辨率的全英污染模型。
NVIDIA 介绍 DSX 平台在 AI 工厂电力管理上的进展。Lambda 在 HGX B200 五机架 19 节点集群上验证 DSX MaxLPS,同样电力预算下集群 token 吞吐从约 400 万每秒提升到 500 万每秒。
OpenAI 将 Habitat 从一个 Python 库演进为全球分布式存储平台,服务超过 10 亿 ChatGPT 用户,支撑每秒 2200 万次请求。
Mistral 与 Cloudera 宣布合作,将 Mistral 模型集成到 Cloudera 混合数据平台,企业可在私有云、公有云、本地乃至完全物理隔离环境中运行推理,并可基于自有数据在受控环境训练定制模型,保留数据与模型的所有权。合作旨在满足主权 AI 需求,覆盖 Cloudera 平台上 30 exabytes 的客户管理数据。