跳到正文

#推理

今日 2 条
今天9月30日周三
  1. AWS Machine Learning Blog62

    GPT-6.1 Sol 正式登陆 Amazon Bedrock

    OpenAI 的 GPT-6.1 Sol 在 Amazon Bedrock 正式可用,是 GPT-6 Sol 的重大升级。

    推荐理由:官方发布说明了模型在代理编码等任务上的成本与性能对比,以及 Bedrock 上的安全与数据保留配置,便于评估落地。

9月29日周二
  1. The Decoder76

    Anthropic 发布 Claude Sonnet 5.5,基准接近 Opus 5.5 且每任务成本最多低 30%

    Anthropic 发布 Claude 5.5 系列第二款模型 Claude Sonnet 5.5,输出速度提升超过 30%,因每任务使用更少 token,实际成本最多下降 30%,多项基准接近 Opus 5.5。

    推荐理由:汇总了 Sonnet 5.5 各基准分数、每任务成本变化和高风险网络安全防护细节,便于与 Opus 5.5 及 OpenAI 对位模型做成本比较。

9月23日周三
9月22日周二
9月16日周三
  1. Latent Space64

    TypeSafe 发布决策模型 Jev,宣称比小型前沿 LLM 快 100 倍、成本低 200 倍

    Latent.Space 日报头条报道 TypeSafe 的 Jev 发布:一个用 RLCD 训练、只做决策分类路由打分而不生成文本的模型,宣称比小型前沿 LLM 快 20-200 倍、便宜 40-400 倍且输出 token 免费,社区认为适合替代生产系统中的结构化分类器、裁判和路由策略,但也提醒它需预定义输出格式、不能生成自由文本。

9月9日周三
8月25日周二
  1. Hugging Face Blog66

    IBM Granite 4.2 推理模型家族发布,3B/8B/30B 全系采用 Apache 2.0 开源

    IBM 发布 Granite 4.2 推理模型家族,包含 3B、8B、30B 三个 dense 尺寸,基于 Granite-4.1 基座(从头预训练约 15T tokens,五阶段策略将上下文窗口扩展至 512K tokens),经 CoT 与智能体轨迹数据的 SFT 后,再用异步 GRPO 多阶段 RL 流水线后训练。

    推荐理由:官方完整披露 Granite 4.2 的五阶段预训练、SFT 配比与多阶段 RL 课程设计,读者可以直接对照复现其训练路线。

8月21日周五
  1. Hugging Face Blog60

    Liquid AI 为 LFM2.5 系列发布 DSpark 草稿模型,推理最高提速 3.18x

    Liquid AI 为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 三个模型发布 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下提升解码速度。

    推荐理由:原文给出三类模型的加速数字、质量不变的原理和 llama.cpp、SGLang 的接入命令,读者可据此评估端侧与 GPU 推理收益。

8月10日周一
7月21日周二
7月6日周一
7月2日周四
  1. Mistral AI65

    Mistral 发布 Leanstral 1.5:6B 激活参数的形式化证明模型

    Mistral 发布 Apache-2.0 开源的 Leanstral 1.5,总参数 119B、激活 6B,专攻 Lean 4 形式化证明。模型饱和 miniF2F,解出 PutnamBench 587/672 题,在 FATE-H 87%、FATE-X 34% 达到新 SOTA,成本约每题 $4。

    推荐理由:官方给出了完整训练流程、基准数字和开源获取方式,读者可以据此评估它在 Lean 4 形式化证明上的实际可用性。

6月11日周四
  1. Google DeepMind74

    Google DeepMind 发布开源实验模型 DiffusionGemma,GPU 文本生成最快提速 4 倍

    Google DeepMind 发布开源实验模型 DiffusionGemma,采用 26B 总参数、3.8B 激活的 MoE 扩散架构,在专用 GPU 上文本生成最高提速 4 倍,单块 NVIDIA H100 超过 1000 tokens/s,RTX 5090 超过 700 tokens/s。

    推荐理由:官方给出扩散文本生成的速度数据、显存占用与质量取舍,适合评估本地交互场景的落地条件。

5月16日周六
4月3日周五
3月17日周二
  1. Mistral AI67

    Mistral 发布 Mistral Small 4,统一推理、多模态与编码能力并以 Apache 2.0 开源

    Mistral 发布 Mistral Small 4,是首个将 Magistral 推理、Pixtral 多模态和 Devstral 智能体编码能力统一到单一模型的小型旗舰,采用 Apache 2.0 许可开源。

    推荐理由:原文给出架构参数、reasoning_effort 用法和与 GPT-OSS 120B 的输出效率对比,读者可据此评估部署成本与选型。

12月3日周三
6月10日周二