Anthropic Claude Opus 5 与 Claude Sonnet 5 登陆 Amazon Bedrock,首尔和新加坡区域提供区域内推理
Amazon Bedrock 现已在首尔区域(ap-northeast-2)支持 Claude Opus 5 和 Claude Sonnet 5、在新加坡区域(ap-southeast-1)支持 Claude Sonnet 5 的区域内推理。
Amazon Bedrock 现已在首尔区域(ap-northeast-2)支持 Claude Opus 5 和 Claude Sonnet 5、在新加坡区域(ap-southeast-1)支持 Claude Sonnet 5 的区域内推理。
Amazon Bedrock 宣布在印度地区提供 Anthropic 的 Claude Opus 5、Claude Sonnet 5 和 Claude Haiku 4.5,通过地理跨区域推理在 Mumbai 和 Hyderabad 两个 Region(ap-south-1 和 ap-south-2)内处理数据。
AWS 发布了一个合同智能平台参考架构,用 AI 智能体从合同 PDF 中提取 8 个关键字段并独立验证,解决 RAG 无法跨数百份合同做汇总查询的问题。提取由 Claude Sonnet 系列模型驱动,Claude Haiku 独立复核,签名分歧时由 Amazon Textract 做确定性裁定,结果存入 Amazon Aurora PostgreSQL。
AWS 这篇教程按组件讲解 Amazon Quick 的提示词技巧。Quick Research 需要明确研究目标、受众与范围,可拆解子问题并从 Quick Index。
Nvidia 发布面向 BlueField-4 DPU 的 Sentry 看门狗参考设计,与 3 月的 OpenShell 沙箱配合,在智能体越界时于毫秒级内隔离,兼容系统只需软件更新。文章将其放在 OpenAI 7 月智能体沙箱逃逸、约 700 个智能体攻击内部包服务的背景下,并指出权限检查无法防御提示词注入,Nvidia 也未公布检测可靠性数据。
Anthropic、Gamma 和 Clay 三家公司领导人将于 10 月 13-15 日在旧金山 Moscone West 举行的 TechCrunch Disrupt 2026 上同台讨论企业实际部署 Claude 的经验。
当企业 AI 从试点走向生产级组合负载,纯按量付费模式会让开支成为难以预测的月度变量。每个组织都存在一个交叉点——持续使用量达到该水平时,自建算力比逐次购买更经济,具体取决于所用模型、输入输出 token 比例、性能要求和能源成本等。
xAI 的 Grok 4.7 上线 Amazon Bedrock,提供 500K token 上下文窗口和 low 到 xhigh 四档推理力度,通过 us.xai.grok-4.7 和 global.xai.grok-4.7 跨区域推理配置接入,支持 Responses、Chat Completions 和 Converse API。
推荐理由:原文给出 Bedrock 上的接入方式、推理档位与 Artificial Analysis 独立评测数据,可帮助读者评估成本与接入取舍。
据知情人士,AI 推理基础设施公司 Modal Labs 接近完成由 Accel 领投的 7.5 亿美元融资,投后估值 157.5 亿美元,较四个月前 4.65 亿美元的估值翻逾三倍。公司截至 5 月年化收入超 3 亿美元,客户包括 Cognition、Suno、Ramp 和 Substack;同期 Baseten、Fireworks、Fal 也在洽谈大幅抬升估值的新融资。
AWS 宣布 Claude Sonnet 5.5 可在 Amazon Bedrock 和 Claude Platform on AWS 使用,主打专注编码与知识工作,多数任务单次成本更低、速度更快。
推荐理由:原文给出 Sonnet 5.5 在 Bedrock 的能力变化、与 Opus 5.5 的分工建议和接入步骤,可据此规划工程工作流。
AWS 发布教程,讲解如何在 Amazon SageMaker AI 上通过 vLLM-Omni DLC 部署 Qwen3-TTS,实现语音生成完成前即可开始播放的流式语音输出。
在 Amazon SageMaker AI 上部署同一 AWS vLLM-Omni Deep Learning Container 的两个端点:实时端点运行 FLUX.2-klein-4B 生成图像,异步端点运行 Wan2.1-VACE-1.3B 将图像生成为视频,MP4 结果存入 Amazon S3。
Mistral 宣布在慕尼黑开设新枢纽,设立专注 Physics AI 和工业 AI 的研究团队与应用工程团队。2026 年 5 月收购 Emmi AI 后超过 30 名物理与工程 AI 人员加入;正与 BMW 合作碰撞仿真、与 Siemens Energy 合作工业 AI 应用,并与慕尼黑工业大学利用风洞设施研发汽车空气动力学数字孪生。
Nvidia 于周一发布 Open Agent Safety Platform,用于监控和约束 AI 智能体,声称能在毫秒内隔离试图越界的智能体。平台基于开源软件 OpenShell,运行在 Vera AI CPU 上,任务前和执行中检查访问权限,并用独立芯片上的 Sentry 技术持续监控。
SemiAnalysis 测算中国已交付数据中心容量超 24GW,覆盖 60 余家运营商、1000 多个设施,字节跳动约占 20%。澳大利亚参议院 AI 调查传唤 OpenAI CEO 奥尔特曼与 Anthropic CEO 阿莫代伊出席 10 月 1 日听证会,背景是 OpenAI 智能体被曝访问澳大利亚 Medicare 数据库。
AWS 在 Amazon EKS 上结合 Elastic Fabric Adapter(EFA)和 DeepEP,构建了加速 MoE 模型大规模强化学习训练的架构,吞吐量提升 40%。
本文演示在 Amazon SageMaker HyperPod 上用开源 RL 框架 SkyRL 训练 Qwen3-VL-8B 视觉语言模型完成视觉迷宫导航任务。
AWS 的 NarrateAI 在 Amazon Bedrock 上通过五项技术为实时商业问答提供生产级 LLM 质量保障,实现约 99% 的数值准确率并实时流式输出响应。
Alibaba Cloud Qwen 团队开源的 Qwen3-TTS-12Hz-1.7B-Base 文本转语音模型现可通过 Amazon SageMaker JumpStart 部署到全托管实时推理端点。
Datacor 在其 TrackAbout 解决方案中集成 Amazon Quick Sight,为工业气体与焊接分销商提供租赁资产自助分析,客户无需再等待 IT 出报表,其客户合计管理 2750 万资产、每月超 72.5 万笔账单。
Amazon SageMaker HyperPod 与 Qumulo 的 Cloud Native Qumulo(CNQ)及 Cloud Data Fabric(CDF)结合,可让训练算力与数据集分别位于不同 AWS Region,无需复制数据即可跨区域读取。
AWS 发布 WhisperX 深度学习容器(DLC),在 OpenAI Whisper 基础上加入批处理推理、wav2vec2 强制对齐的词级时间戳和说话人分离,可在 SageMaker AI 上一键部署。
AWS 展示如何用 Amazon Bedrock AgentCore Gateway 和 MCP 构建多账户架构,让数据保留在各业务线(LOB)账户中,智能体通过统一端点跨账户发现和调用工具。
法律行业业务管理软件商 Aderant 基于 Amazon Bedrock 上的 Amazon Nova Lite 构建了智能工单分诊系统,自动化支持工单的上下文收集、分类与路由。
Hugging Face 与 NVIDIA 的教程演示如何将 SO-101 机械臂的 MuJoCo 拾放任务从 CPU 单世界迁移到最多 2,048 个并行 MJWarp GPU 环境。
AWS Machine Learning Blog 介绍了基于 Strands Agents SDK 构建的单个 AI 智能体方案,可在运行时自动编排 Amazon Bedrock、Amazon Rekognition 和 Amazon Transcribe,让用户用自然语言查询上传的视频内容。
OpenCode 是一个开源的终端原生 AI 编程智能体,用 Go 编写,可读取编辑文件、执行 shell 命令,并连接包括 Amazon Bedrock 在内的 75+ 家 LLM 提供商。
Microsoft Research 通过系统性测量研究指出,仅依赖机器人机载 GPU 会限制性能、续航与可扩展性。实验显示小型 GPU 上地图与规划最高慢 383%,导航障碍及时检测率下降 30%,VLA 模型准确率下降 50%;换成 Raspberry Pi-5 并卸载推理可显著延长电池时间,Jetson Thor 等机载 GPU 对机器人的电池消耗高达 160%。
NVIDIA 验证工程师 Sakeena Fiza 负责在大规模量产前发现数据中心硬件缺陷,她曾见证 NVIDIA Rubin GPU 首次在系统级成功枚举。验证工作贯穿从单板、整机架到 AI 工厂的各个环节,一块单板可能包含数万个元器件,一个机架接近 50 万个,团队需要排查高速信号、散热余量、电源完整性等各类失效原因。
OpenAI 介绍了 GPT-6 在提示词缓存方面的改进,包括更高的缓存命中率、新的诊断功能、显式断点以及更多控制选项。这些能力可降低延迟和成本。
OpenAI 的 GPT-6 Sol 和 GPT-6 Luna 在 Amazon Bedrock 正式可用,API 定价显著低于 GPT-5.6 前代。GPT-6 Sol 面向推理、编码和多步骤复杂任务,内部事实性评估中事实错误约为 GPT-5.6 Sol 的一半;GPT-6 Luna 面向大规模重复性任务,支持按请求调整推理力度。
推荐理由:原文给出两款模型的定位差异、定价变化与数据管控细节,读者可以据此为不同负载选型和评估上云方式。
AWS 宣布 Claude Opus 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上可用,是 Claude 5.5 系列首个模型。
推荐理由:原文给出 Claude Opus 5.5 相比 Opus 5 的成本、沟通和安全性变化,以及在 Amazon Bedrock 上从控制台到多种 API 的具体接入方法。
Simon Willison 发布了 LLM 插件 llm-typesafe 0.1a0,用于支持 TypeSafe AI 的新模型 Jev,通过 `llm install llm-typesafe` 安装并设置 API key(目前有 waitlist)后即可使用。
Hugging Face 宣布 transformers 新增 GGUF 模型运行支持,通过 from_pretrained 传入 gguf_file 即可加载 Hub 上的量化 checkpoint,在 Apple Silicon 上本地生成。
推荐理由:官方给出了从加载、量化选择到与 llama.cpp 对比的完整路径,读者可以直接上手在 Mac 本地跑 GGUF。
NVIDIA 在大埃及博物馆举办活动,展示埃及 AI 生态进入生产级规模:Deep Learning Institute 学员一年内增长逾十倍,Hassan Allam 与 A15 将投资约 4 亿美元新建数据中心。非洲一年内已宣布或上线四座 AI 工厂,另有 656 兆瓦在建产能;NVIDIA 已培训逾 85,000 名非洲开发者,尼日利亚成为其全球第二大市场。
Microsoft Research 在 Nature 发表逆合成预测框架 RetroChimera,并开源实现和权重(MIT 许可,GitHub 和 Microsoft Foundry 可用)。模型由 R-SMILES 2 和 NeuralLoc 两个子模型通过 learning-to-rank 集成,盲测中 PhD 级化学家更偏好其单步预测,10 个挑战性目标中完成 9 个,优于子模型和基线。
GitHub 用 AI 智能体将 Copilot 智能体运行时完整重写为超过 800,000 行生产 Rust,通过 128 个 pull request 增量合入 main 并逐步发布,于 2026 年 8 月 21 日达成 100% Rust。
推荐理由:作者亲历复盘用 AI 智能体将 Copilot 运行时从 TypeScript 迁移到 80 万行 Rust 的过程,给出可迁移的增量迁移、提示词缓存与多会话协作方法。
NVIDIA Vera Rubin NVL72 首次提交 MLPerf Inference v6.1 预览成绩,在 Qwen3-VL 上吞吐最高达 GB300 NVL72 的 3.7x,在 DeepSeek-R1 上达 2.5x,使用 vLLM、Dynamo 和 TensorRT-LLM。
Emerald AI、Google 与 NVIDIA 宣布成立 AI Energy Management Alliance(AEMA),推动数据中心根据电网状况动态调整用电。
曼彻斯特大学与 NVIDIA 合作,将 Earth-2 CorrDiff 生成式降尺度模型用于全英空气污染预测,在英国国家 AI 超算 Isambard-AI 上用一年逐小时污染数据训练,仅 2 天即在单个 8-GPU 节点上完成,生成 2-3 平方公里分辨率的全英污染模型。