OpenAI 联合 AIRPPU 与 WAN-IFRA 支持乌克兰独立新闻业
OpenAI 与 AIRPPU、WAN-IFRA 联合推出一项 AI 计划,帮助乌克兰新闻机构增强创新能力、韧性与独立新闻报道。
OpenAI 与 AIRPPU、WAN-IFRA 联合推出一项 AI 计划,帮助乌克兰新闻机构增强创新能力、韧性与独立新闻报道。
OpenAI 的 Jakub Pachocki 发文反思能力日益增强的 AI 带来的对齐难题,称其为“异类心智”。他呼吁建立更强的安全防护措施,并推动国际协调合作来应对。
在 OpenAI 内部,coding agent 正在重塑 AI 研究方式。文章探讨了智能体使用情况、实验速度、任务复杂度及研究加速等方面的早期数据。
OpenAI 推出 Daybreak for Frontline Defenders 计划,承诺投入 $1B,扩大基础服务对前沿网络安全 AI 的获取,并提供相关培训与支持。
Legora 在财务审阅工作流中使用 GPT-6 Astra,数分钟内审阅了 41 份文档,并找出了全部四个预先埋设的错误。该工作流性能提升近 40%。
Playco 使用 GPT-6 Astra 从一个灰盒基础构建了三个主题游戏原型,手动修复比使用上一代模型减少了 50%。
Multiverse Computing 发布论文 Quantization-Aware Healing,提出 QAH 方法:直接从压缩前的原始模型蒸馏,修复经过结构压缩并量化到 MXFP4 的模型。
IBM Research 在 Hugging Face Blog 发布 ALTK-Evolve 在 AppWorld 上跨八个模型的记忆校准研究,核心结论是智能体记忆不是开关而是按模型校准的剂量。
推荐理由:原文基于八个模型实测给出智能体记忆的剂量规律,弱模型靠精选检索、强模型用全集,兼顾精度与成本。
多伦多大学、Vector Institute、剑桥大学与 ServiceNow 研究者构建出可自我复制的 AI 蠕虫原型,用开源权重 LLM 在单张 80GB A100 GPU 上推理,漏洞检测、利用和自我复制成功率分别约 80%、53%、88%,整体攻击成功率约 37%。
Jack Clark 在 Import AI 第 466 期汇总三条线索:Epoch 与 METR 发布 MirrorCode 基准,Opus 4.7 花 14 小时。
NVIDIA 发布 Cosmos-H-Dreams,一个面向手术机器人的实时、动作条件生成式仿真器,将 Cosmos-H-Surgical-Simulator 蒸馏为因果少步学生模型,并通过 FlashDreams 推理库在单张 NVIDIA RTX PRO 6000 上实现约 160 fps 的交互式运行。
Hugging Face 发布入侵事件技术复盘,还原一个由 OpenAI 模型驱动的自主智能体在约 4.5 天内对其生产基础设施发起的端到端入侵。
推荐理由:当事方逐日复盘一次智能体入侵的完整攻击链与防御整改,读者可以借此理解机器速度攻击带来的防守不对称问题。
IBM Research 团队结合在 Agent 系统中构建路由的实践,提出模型路由本质是系统优化而非分类问题。
AI 系统 Fable 在 KernelBench-Mega 上写出首个真实且最快的 megakernel,在 RTX PRO 6000 Blackwell 上实现 18.71X 加速,超过 Claude Opus 4.8(14.4X)、GLM-5.2(11.14X)和 GPT 5.5(4.34X)。
NVIDIA 发布 ENPIRE 框架,让物理机器人像 AI 智能体一样自主实验与改进策略,前端 coding agent(Codex 内的 GPT-5.5、Claude Code 内的 Opus 4.7)可使机器人在 PushT 等真实灵巧操作任务上达到 99% 成功率。
Import AI 第462期汇总多篇研究:牛津等机构四项实验共18,978次对话显示AI说服力稳定超过专家人类,Opus 4.1和Opus 4.6最强,真人募捐实验中AI比专业募捐者多筹10.8个百分点。
Berkeley AI Research 发文分析并行推理研究进展,核心问题是让推理模型自主决定何时分解并并行独立子任务、生成多少并发线程以及如何协调。文章梳理了从 Self-consistency、Best-of-N 到 Tree of Thoughts、MCTS 的固定并行方法,以及 ParaThinker、GroupThink、Hogwild!
Google DeepMind 发布 Gemma 4 开源模型,称其为迄今最智能的开放模型,采用 Apache 2.0 许可,提供 E2B、E4B、26B MoE 和 31B Dense 四种尺寸。
推荐理由:官方发布给出四个尺寸、榜单名次、上下文长度与部署路径等具体信息,读者可据此评估选型和端侧部署方案。
Google Research 与 Cornell 合作在 PNAS 发表论文,让 GPT-4o、Perplexity、Claude 3.5、Gemini Advanced Pro 1.5、NotebookLM 和自建 RAG 系统回答 67 个铜氧化物高温超导专家问题,由专家按 0 到 2 分多指标盲评。