跳到正文

#推理

今日 2 条
今天9月30日周三
  1. AWS Machine Learning Blog62

    GPT-6.1 Sol 正式登陆 Amazon Bedrock

    OpenAI 的 GPT-6.1 Sol 在 Amazon Bedrock 正式可用,是 GPT-6 Sol 的重大升级。

    推荐理由:官方发布说明了模型在代理编码等任务上的成本与性能对比,以及 Bedrock 上的安全与数据保留配置,便于评估落地。

9月29日周二
  1. AWS Machine Learning Blog67

    Grok 4.7 上架 Amazon Bedrock,支持 500K 上下文与四档推理力度

    xAI 的 Grok 4.7 上线 Amazon Bedrock,提供 500K token 上下文窗口和 low 到 xhigh 四档推理力度,通过 us.xai.grok-4.7 和 global.xai.grok-4.7 跨区域推理配置接入,支持 Responses、Chat Completions 和 Converse API。

    推荐理由:原文给出 Bedrock 上的接入方式、推理档位与 Artificial Analysis 独立评测数据,可帮助读者评估成本与接入取舍。

  2. The Decoder76

    Anthropic 发布 Claude Sonnet 5.5,基准接近 Opus 5.5 且每任务成本最多低 30%

    Anthropic 发布 Claude 5.5 系列第二款模型 Claude Sonnet 5.5,输出速度提升超过 30%,因每任务使用更少 token,实际成本最多下降 30%,多项基准接近 Opus 5.5。

    推荐理由:汇总了 Sonnet 5.5 各基准分数、每任务成本变化和高风险网络安全防护细节,便于与 Opus 5.5 及 OpenAI 对位模型做成本比较。

9月28日周一
  1. Import AI31

    Import AI 474:柏拉图心灵空间、太空中的 TPU、智谱开启外层 RSI 循环

    Michael Levin 发表论文提出非物理主义心灵模型:心灵如同数学模式之于物理结果,是“柏拉图式模式空间”进入物理世界的接口,活体、工程或混合躯体都承载这一多尺度模式层级。文中以 xenobots(蛙细胞生物机器人)和人类气管细胞制成的 anthrobots 为例,说明简单系统能展现算法未预设的复杂行为。作者认为这一视角或有助于思考 AI 引发的对齐与哲学问题。

9月26日周六
9月24日周四
  1. Hugging Face Blog60

    Liquid AI 发布 LFM2.5-VL-3B-DSpark 草稿模型,视觉语言模型解码提速最高 3.13x

    Liquid AI 为视觉语言模型 LFM2.5-VL-3B 发布实验性 DSpark 草稿模型,通过投机解码在不改变输出质量的前提下加速推理。解码最高提速 3.13x(M5 Max 端侧)和 2.66x(H100),端到端最高提升 2.62x 和 2.27x;草稿模型增加 280M 参数(约 8.9%),首日支持 llama.cpp、MLX-VLM 和 SGLang。

    推荐理由:原文给出视觉语言模型投机解码加速的具体数字、内存开销和第一天框架支持,读者可以据此评估端侧与 GPU 部署收益。

9月23日周三
9月22日周二
9月21日周一
9月16日周三
  1. Latent Space64

    TypeSafe 发布决策模型 Jev,宣称比小型前沿 LLM 快 100 倍、成本低 200 倍

    Latent.Space 日报头条报道 TypeSafe 的 Jev 发布:一个用 RLCD 训练、只做决策分类路由打分而不生成文本的模型,宣称比小型前沿 LLM 快 20-200 倍、便宜 40-400 倍且输出 token 免费,社区认为适合替代生产系统中的结构化分类器、裁判和路由策略,但也提醒它需预定义输出格式、不能生成自由文本。

9月9日周三
9月8日周二
8月25日周二
  1. Hugging Face Blog66

    IBM Granite 4.2 推理模型家族发布,3B/8B/30B 全系采用 Apache 2.0 开源

    IBM 发布 Granite 4.2 推理模型家族,包含 3B、8B、30B 三个 dense 尺寸,基于 Granite-4.1 基座(从头预训练约 15T tokens,五阶段策略将上下文窗口扩展至 512K tokens),经 CoT 与智能体轨迹数据的 SFT 后,再用异步 GRPO 多阶段 RL 流水线后训练。

    推荐理由:官方完整披露 Granite 4.2 的五阶段预训练、SFT 配比与多阶段 RL 课程设计,读者可以直接对照复现其训练路线。

8月21日周五
  1. Hugging Face Blog60

    Liquid AI 为 LFM2.5 系列发布 DSpark 草稿模型,推理最高提速 3.18x

    Liquid AI 为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 三个模型发布 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下提升解码速度。

    推荐理由:原文给出三类模型的加速数字、质量不变的原理和 llama.cpp、SGLang 的接入命令,读者可据此评估端侧与 GPU 推理收益。

8月18日周二
  1. Hugging Face Blog52

    Dharma AI 发布约束感知 GPU 调度器:同集群利用率最高提升 33 个百分点

    Dharma AI 在 Hugging Face Blog 发布约束感知 GPU 分配器,与 FIFO 调度器在 7 个基准场景对比,GPU 利用率最高提升 33 个百分点,优先级加权产出平均提升 52%。该调度器将实时推理视为需求曲线而非峰值预留,批任务按优先级在 24 小时视野内规划,每次决策仅 1 至 15 毫秒,每个时间步只提交当前分配并每 30 至 60 分钟重跑以吸收预测误差。

8月17日周一
  1. Import AI36

    Import AI 469:科学 AI、RSI 模拟器与 Zuck 的技术悲观主义

    DiG-bench 发布,一个由 70 款隐藏规则游戏组成的基准,测试模型通过探索发现环境规则的能力。Opus 5 和 Fable 5(配合 Claude Code)表现最好,是仅有的能在最难的 Tier 7 得分(0.2)的模型,但远低于人类 100% 的成绩。Inherent 则发布 Faraday,用较小的开源权重模型监督前沿模型做科学研究。

8月12日周三
8月11日周二
8月10日周一
7月31日周五
7月27日周一
7月23日周四
  1. Google Research66

    Google Research 发布 SymptomAI 研究论文,评估对话式 AI 症状评估的 réel 世界表现

    Google Research 发布 SymptomAI 研究,13,917 名参与者与五个 Gemini Flash 2.0 症状评估智能体对话进行鉴别诊断。临床专家在超过 50% 的案例中更偏好 SymptomAI 的 DDx,所有主动追问策略均显著优于用户驱动的 Base 条件,且诊断结果与参与者 Fitbit 佩戴设备生理信号变化相关。研究强调所有诊断仅供研究分析,不构成临床诊断。

    推荐理由:原文给出真实人群随机研究和临床对照结果,读者可了解对话式症状评估在非理想化场景下的实际表现。

7月21日周二
7月10日周五
7月6日周一
7月2日周四
  1. Mistral AI65

    Mistral 发布 Leanstral 1.5:6B 激活参数的形式化证明模型

    Mistral 发布 Apache-2.0 开源的 Leanstral 1.5,总参数 119B、激活 6B,专攻 Lean 4 形式化证明。模型饱和 miniF2F,解出 PutnamBench 587/672 题,在 FATE-H 87%、FATE-X 34% 达到新 SOTA,成本约每题 $4。

    推荐理由:官方给出了完整训练流程、基准数字和开源获取方式,读者可以据此评估它在 Lean 4 形式化证明上的实际可用性。

6月30日周二
6月27日周六
6月25日周四
6月22日周一
6月11日周四
  1. Google DeepMind74

    Google DeepMind 发布开源实验模型 DiffusionGemma,GPU 文本生成最快提速 4 倍

    Google DeepMind 发布开源实验模型 DiffusionGemma,采用 26B 总参数、3.8B 激活的 MoE 扩散架构,在专用 GPU 上文本生成最高提速 4 倍,单块 NVIDIA H100 超过 1000 tokens/s,RTX 5090 超过 700 tokens/s。

    推荐理由:官方给出扩散文本生成的速度数据、显存占用与质量取舍,适合评估本地交互场景的落地条件。

6月8日周一
  1. Google DeepMind67

    Google DeepMind 发布塞拉利昂 Gemini Guided Learning 对照试验结果

    Google DeepMind 公布在塞拉利昂开展的预注册对照试验结果,使用 Guided Learning 的学生数学成绩较对照组提升 0.258 个标准差,约相当于 1.2 至 1.7 年的常规学习进度。

    推荐理由:原文给出预注册RCT的关键数据和开放式材料,读者可以了解AI辅助教学在真实课堂中的效果与局限。