跳到正文

#模型发布

今日 2 条
今天9月30日周三
  1. AWS Machine Learning Blog62

    GPT-6.1 Sol 正式登陆 Amazon Bedrock

    OpenAI 的 GPT-6.1 Sol 在 Amazon Bedrock 正式可用,是 GPT-6 Sol 的重大升级。

    推荐理由:官方发布说明了模型在代理编码等任务上的成本与性能对比,以及 Bedrock 上的安全与数据保留配置,便于评估落地。

9月29日周二
  1. AWS Machine Learning Blog67

    Grok 4.7 上架 Amazon Bedrock,支持 500K 上下文与四档推理力度

    xAI 的 Grok 4.7 上线 Amazon Bedrock,提供 500K token 上下文窗口和 low 到 xhigh 四档推理力度,通过 us.xai.grok-4.7 和 global.xai.grok-4.7 跨区域推理配置接入,支持 Responses、Chat Completions 和 Converse API。

    推荐理由:原文给出 Bedrock 上的接入方式、推理档位与 Artificial Analysis 独立评测数据,可帮助读者评估成本与接入取舍。

9月28日周一
9月24日周四
  1. Hugging Face Blog60

    Liquid AI 发布 LFM2.5-VL-3B-DSpark 草稿模型,视觉语言模型解码提速最高 3.13x

    Liquid AI 为视觉语言模型 LFM2.5-VL-3B 发布实验性 DSpark 草稿模型,通过投机解码在不改变输出质量的前提下加速推理。解码最高提速 3.13x(M5 Max 端侧)和 2.66x(H100),端到端最高提升 2.62x 和 2.27x;草稿模型增加 280M 参数(约 8.9%),首日支持 llama.cpp、MLX-VLM 和 SGLang。

    推荐理由:原文给出视觉语言模型投机解码加速的具体数字、内存开销和第一天框架支持,读者可以据此评估端侧与 GPU 部署收益。

9月23日周三
  1. Google DeepMind65

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 语音生成模型

    Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,覆盖 100 多种语言和方言,支持从 30 秒音频样本复刻声音、逐行导演表演节奏以及原生双说话人场景编排。

    推荐理由:官方发布说明了两个 TTS 模型的定位、评测成绩和语音设计能力,开发者可以直接对照评测与入口评估是否接入。

  2. OpenAI News62

    OpenAI 发布 GPT-6 Sol 和 Luna 两款模型

    OpenAI 发布 GPT-6 Sol 和 Luna 两个模型,将前沿智能带入日常工作,两者在能力与成本之间提供不同的平衡。

    推荐理由:官方宣布 GPT-6 Sol 和 Luna 两个模型,定位在能力与成本间做不同取舍,可关注两者的差异化定位。

9月22日周二
9月16日周三
9月14日周一
9月10日周四
9月9日周三
9月3日周四
9月1日周二
  1. Google Research49

    Google 发布 TimesFM-3:单次前向传播完成零样本多变量时序预测

    Google 发布时序基础模型 TimesFM-3,原生支持多变量零样本预测,参数量 330M,预训练语料包含超过 1 万亿时间点。模型采用 decoder-only Transformer 与交替注意力架构,通过 Contiguous Patch Masking 在单次前向传播中生成完整预测区间,并为每个目标输出 10% 到 90% 共 9 个分位数。

8月28日周五
8月25日周二
  1. Hugging Face Blog66

    IBM Granite 4.2 推理模型家族发布,3B/8B/30B 全系采用 Apache 2.0 开源

    IBM 发布 Granite 4.2 推理模型家族,包含 3B、8B、30B 三个 dense 尺寸,基于 Granite-4.1 基座(从头预训练约 15T tokens,五阶段策略将上下文窗口扩展至 512K tokens),经 CoT 与智能体轨迹数据的 SFT 后,再用异步 GRPO 多阶段 RL 流水线后训练。

    推荐理由:官方完整披露 Granite 4.2 的五阶段预训练、SFT 配比与多阶段 RL 课程设计,读者可以直接对照复现其训练路线。

8月21日周五
8月14日周五
8月12日周三
  1. Microsoft Research47

    微软研究院推出 CARE-X:面向临床实用放射影像 VLM 的辅助监督、奖励对齐学习与工具增强测量

    微软研究院发布研究模型 CARE-X,一个统一的胸部 X 光 VLM,结合生成式与判别式双推理,支持报告生成、疾病定位、多标签分类等多样临床解读任务。该模型采用 DAPO 强化学习在多任务设置中奖励临床正确性,并在 Narayana Health 的真实印度临床数据上验证。另一项独立实验将 Qwen3-VL-4B-Instruct 与确定性测量工具配对,评估直接计算能否提升测量依赖病灶的表现。

8月10日周一
8月4日周二
  1. Mistral AI62

    Mistral 发布开源多模态安全分类器 Shieldstral

    Mistral 发布 3B 开源权重多模态安全分类器 Shieldstral,将内容审核建模为策略自适应的问答任务,在推理时接受自然语言策略并输出校准的安全分数。该模型在文本安全上匹敌最大 7 倍于其体量的开放护栏模型,在多模态审核上创造新 SOTA,以 Apache 2.0 协议开放权重,可在单张 16GB GPU 上运行。

    推荐理由:原文给出把内容审核改写成策略自适应问答的建模思路和数据构建方法,对做安全分类器的团队有可迁移的参考价值。

7月30日周四
7月28日周二
  1. Google DeepMind69

    Google DeepMind 发布 Gemini Robotics 2,实现机器人全身智能控制

    Google DeepMind 发布 Gemini Robotics 2 系列机器人模型,包含 VLA 模型 Gemini Robotics 2、具身推理模型 Gemini Robotics ER 2 和端侧模型 Gemini Robotics On-Device 2。

    推荐理由:官方一次性放出 VLA、具身推理和端侧三个机器人模型,读者可以借此了解全身控制、灵巧操作与多机协作的具体进展。

7月21日周二
7月17日周五
7月15日周三
  1. Hugging Face Blog81

    Thinking Machines 发布开源多模态大模型 Inkling 及 Inkling-Small

    Thinking Machines 在 Hugging Face 发布开源多模态模型 Inkling,总计 975B 参数、激活 41B 的 MoE 架构,原生接受图像、文本和音频输入,支持 1M 上下文,训练数据为 45 万亿 token。

    推荐理由:原文给出 Inkling 与 Inkling-Small 的架构细节、部署配置和多份基准数字,可帮助读者评估其在多模态推理场景的可用性。

7月8日周三
7月2日周四
  1. Mistral AI65

    Mistral 发布 Leanstral 1.5:6B 激活参数的形式化证明模型

    Mistral 发布 Apache-2.0 开源的 Leanstral 1.5,总参数 119B、激活 6B,专攻 Lean 4 形式化证明。模型饱和 miniF2F,解出 PutnamBench 587/672 题,在 FATE-H 87%、FATE-X 34% 达到新 SOTA,成本约每题 $4。

    推荐理由:官方给出了完整训练流程、基准数字和开源获取方式,读者可以据此评估它在 Lean 4 形式化证明上的实际可用性。

6月30日周二
6月23日周二
6月11日周四
  1. Google DeepMind74

    Google DeepMind 发布开源实验模型 DiffusionGemma,GPU 文本生成最快提速 4 倍

    Google DeepMind 发布开源实验模型 DiffusionGemma,采用 26B 总参数、3.8B 激活的 MoE 扩散架构,在专用 GPU 上文本生成最高提速 4 倍,单块 NVIDIA H100 超过 1000 tokens/s,RTX 5090 超过 700 tokens/s。

    推荐理由:官方给出扩散文本生成的速度数据、显存占用与质量取舍,适合评估本地交互场景的落地条件。

6月9日周二
  1. Google DeepMind75

    Google DeepMind 发布 Gemma 4 12B:无编码器统一多模态模型

    Google DeepMind 发布 Gemma 4 12B,可在 16GB 内存或显存的笔记本本地运行,性能接近其 26B MoE 模型但内存占用不足一半。该模型采用无编码器统一架构,视觉与音频输入直接进入 LLM 主干,是首个支持原生音频输入的中等规模 Gemma 模型,以 Apache 2.0 许可发布,并同步推出官方 Skills 仓库。

    推荐理由:原文来自官方发布,给出架构细节、内存门槛和下载入口,可帮助读者评估在本地设备运行多模态模型的可行性。