OpenAI 推出 proactive 智能体 dots
OpenAI 推出 dots,一类主动式(proactive)智能助手,可在复杂项目和日常任务中持续推进工作。dots 的设计让工作在向前推进的同时,用户始终保有控制权。
OpenAI 推出 dots,一类主动式(proactive)智能助手,可在复杂项目和日常任务中持续推进工作。dots 的设计让工作在向前推进的同时,用户始终保有控制权。
OpenAI 的 GPT-6.1 Sol 在 Amazon Bedrock 正式可用,是 GPT-6 Sol 的重大升级。
推荐理由:官方发布说明了模型在代理编码等任务上的成本与性能对比,以及 Bedrock 上的安全与数据保留配置,便于评估落地。
AWS 发布了一个合同智能平台参考架构,用 AI 智能体从合同 PDF 中提取 8 个关键字段并独立验证,解决 RAG 无法跨数百份合同做汇总查询的问题。提取由 Claude Sonnet 系列模型驱动,Claude Haiku 独立复核,签名分歧时由 Amazon Textract 做确定性裁定,结果存入 Amazon Aurora PostgreSQL。
AWS 这篇教程按组件讲解 Amazon Quick 的提示词技巧。Quick Research 需要明确研究目标、受众与范围,可拆解子问题并从 Quick Index。
Hugging Face 团队提出 ProvenanceGuard,一个针对基于 MCP 的 LLM 智能体的生成后验证层,能检测“跨来源混淆”——事实存在但被归因到错误来源的情况。
xAI 的 Grok 4.7 上线 Amazon Bedrock,提供 500K token 上下文窗口和 low 到 xhigh 四档推理力度,通过 us.xai.grok-4.7 和 global.xai.grok-4.7 跨区域推理配置接入,支持 Responses、Chat Completions 和 Converse API。
推荐理由:原文给出 Bedrock 上的接入方式、推理档位与 Artificial Analysis 独立评测数据,可帮助读者评估成本与接入取舍。
Microsoft Research Asia – Singapore 于 2025 年 7 月 24 日成立,是 Microsoft 在东南亚的首个研究实验室。
AWS 通过 Amazon Nova Act 与 Amazon Bedrock AgentCore 构建智能体驱动的合成监控方案,用自然语言动作替代基于 DOM 选择器的 Selenium、Playwright 脚本。
H 公司发布 Holo4 系列通用计算机使用智能体模型,含 27B dense 与 35B-A3B MoE 两种规格,并附带更新版 Holotron4 Nano。
推荐理由:模型可跨 GUI、代码、MCP 和 API 多种接口工作并开源权重与轨迹,读者可对比其与前沿模型的成本差异来判断适用场景。
Proaction 使用 Codex、GPT-Live-1 和 GPT-6 Astra 更快地构建、运营和销售现代车队管理方案,销售增长 60%,并节省 75+ 小时。
GitHub Copilot app 的 canvases 功能允许用户用 /create-canvas 技能以自然语言描述工作流,生成看板、清单、表单等可定制界面。画布是双向共享的,用户通过按钮、卡片、筛选器操作时智能体同步可见,智能体的改动也实时出现在界面上;创建的画布保存为 extension,可个人复用或团队共享,社区还通过 Awesome Copilot 提供现成扩展。
本文演示在 Amazon SageMaker HyperPod 上用开源 RL 框架 SkyRL 训练 Qwen3-VL-8B 视觉语言模型完成视觉迷宫导航任务。
AWS 的 NarrateAI 在 Amazon Bedrock 上通过五项技术为实时商业问答提供生产级 LLM 质量保障,实现约 99% 的数值准确率并实时流式输出响应。
GitHub Copilot 团队认为聊天不是与 AI 交互的正确界面,介绍了 GitHub Copilot app 中的 canvas 功能,它是可与应用内 agent 双向通信的全栈小程序。作者用 Connect 4 游戏、Winget 包管理、SQLite 操作和自动化开发工作流等示例说明,与其让 agent 处理每次交互浪费 token,不如让它构建一个后续交互免费的自定义工具。
Google Research 推出 AI 视频联合导演研究,基于 Gemini 和 Veo 构建统一多智能体框架,包含 Co-Director、CANVAS、A²RD 和 VQQA 四套框架,将长视频生成建模为全局优化与世界状态跟踪问题。
GitHub Security Lab 的 Antonio Morales 发布 Fuzzing Taskflow,一个基于 Taskflow Agent 的自主模糊测试流水线,只需提供 GitHub 仓库即可自动识别入口点、编写 harness、运行 AFL++、改进覆盖并分诊崩溃。
推荐理由:原文详述了用 LLM Agent 自动写 harness、跑 AFL、追覆盖缺口和分诊崩溃的完整流水线设计,可直接复用。
AWS 展示如何用 Amazon Bedrock AgentCore Gateway 和 MCP 构建多账户架构,让数据保留在各业务线(LOB)账户中,智能体通过统一端点跨账户发现和调用工具。
法律行业业务管理软件商 Aderant 基于 Amazon Bedrock 上的 Amazon Nova Lite 构建了智能工单分诊系统,自动化支持工单的上下文收集、分类与路由。
AWS Machine Learning Blog 介绍了基于 Strands Agents SDK 构建的单个 AI 智能体方案,可在运行时自动编排 Amazon Bedrock、Amazon Rekognition 和 Amazon Transcribe,让用户用自然语言查询上传的视频内容。
OpenCode 是一个开源的终端原生 AI 编程智能体,用 Go 编写,可读取编辑文件、执行 shell 命令,并连接包括 Amazon Bedrock 在内的 75+ 家 LLM 提供商。
Microsoft Research 通过系统性测量研究指出,仅依赖机器人机载 GPU 会限制性能、续航与可扩展性。实验显示小型 GPU 上地图与规划最高慢 383%,导航障碍及时检测率下降 30%,VLA 模型准确率下降 50%;换成 Raspberry Pi-5 并卸载推理可显著延长电池时间,Jetson Thor 等机载 GPU 对机器人的电池消耗高达 160%。
客服公司 Ringg 采用 GPT-5.6 驱动其 AI 智能体,最多可自动解决 65% 的客户来电。这些智能体覆盖语音、聊天、WhatsApp 和网页等多语言渠道,成本相比使用 GPT-4.1 降低 90%。
9月22-23日,NVIDIA 在新加坡 AI Day 上与合作伙伴展示东南亚地区的 AI 进展。新加坡 HTX 基于 Nemotron 3 Super 和 Nemotron 3 Nano Omni 推进公共安全 AI 研究。
AWS 宣布 Claude Opus 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上可用,是 Claude 5.5 系列首个模型。
推荐理由:原文给出 Claude Opus 5.5 相比 Opus 5 的成本、沟通和安全性变化,以及在 Amazon Bedrock 上从控制台到多种 API 的具体接入方法。
NVIDIA 在多伦多 ROSCon 大会上发布 Isaac ROS 5.0,为约 130 万 ROS 用户带来智能体化工作流与平台支持。新版本支持 ROS Lyrical 和 Ubuntu 24.04,新增 FoundationStereo 微调技能与 Agent 就绪文档,FoundationPose 推理库使物体位姿追踪速度提升 5.5x。
OpenAI 的 GPT-6 Astra 帮助 Parallel 的智能体研究和整合劳动力市场数据,与此前模型相比用时和成本均减半。
NVIDIA 发文提出 AI 安全是工程问题,需要明确需求、可执行控制、指定责任人和防护有效性的证据。文章主张安全取决于模型、harness 和运行时构成的完整智能体栈,介绍开源安全运行时 NVIDIA OpenShell 及 Cisco DefenseClaw、JFrog 集成等生态实践,并强调重大变更后需重复测试、由责任人决定是否部署。
V7 采用 GPT-5.6,将成本降低 78%,同时提升准确率。它能将企业分散的文件转化为智能体可用的上下文,完成复杂的、带来源链接的工作。
GitHub Podcast 逐条拆解五个常见 AI 观点:AI 生成代码仍需审查,只需把精力放在高风险处;招聘看重的是判断力而非是否用 AI;Skills 与 MCP 解决不同问题,可以配合使用;RAG 并未过时,仍是让模型获得训练数据外信息的关键;若模型看不懂你的代码库,往往说明代码本身可维护性差。
GitHub 用 AI 智能体将 Copilot 智能体运行时完整重写为超过 800,000 行生产 Rust,通过 128 个 pull request 增量合入 main 并逐步发布,于 2026 年 8 月 21 日达成 100% Rust。
推荐理由:作者亲历复盘用 AI 智能体将 Copilot 运行时从 TypeScript 迁移到 80 万行 Rust 的过程,给出可迁移的增量迁移、提示词缓存与多会话协作方法。
OpenAI 推出全新 AI 广告体验,包括 Sponsored Agents、面向营销人员的工具,以及与 HubSpot 和 Shopify 的集成。
Salesforce 在 Dreamforce 上宣布其首个 CRM 推理模型 Koa,通过对 NVIDIA Nemotron 3 Super 进行后训练打造,因 NVIDIA Nemotron 开源,Salesforce 可在自己的基础设施内微调并运行模型,训练与推理均不使用任何客户数据。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款语音对话模型,主打近实时推理与语音智能体。
推荐理由:官方给出两款语音对话模型的评测成绩、语言与工具调用能力和开放入口,读者可据此评估其用于语音智能体开发的适配度。
NVIDIA 在 AI Infra Summit 上发布 Vera Rubin 与 DSX 平台的多项进展,主题是以每兆瓦 token 产出衡量 AI 工厂能效。
推荐理由:NVIDIA 官方汇总 Vera Rubin 与 DSX 平台在每兆瓦 token 产出上的多项合作实测数据,可帮助读者评估 AI 工厂能效方向。
IBM Research 在开源工具 ALTK-Evolve 中新增一致性指南与 Consistency Analyzer,针对平均准确率掩盖的可靠性问题。
Fyxer 基于 OpenAI 模型打造 AI 高管助理,通过微调、记忆和真实用户反馈来整理收件箱,并以每位用户的口吻起草邮件。
Perplexity 将 GPT-6 Astra 用于端到端系统,包括撰写沟通内容、修改软件以及监控生产系统。与使用早期模型相比,Perplexity 现在对这些系统的检查频率明显降低。
GitHub 日韩营销负责人 Tomoko Tanaka 分享如何不写代码,用 GitHub Issue 表单、标签、Actions 和 Copilot skills 将活动运营从策划到复盘全流程自动化。
Cognition 在 Devin 中引入 GPT-6 Astra,用于改进 Devin 测试软件并验证其可用性的能力。目标是让工程师减少代码审查工作量、交付更多成果。
Google Research 在 ACL 2026 提出 ToolGrad,采用“先答案后提问”的范式生成工具使用训练数据,通过文本“梯度”迭代构建 API 调用链,几乎达到 100% 通过率且成本更低。