Google DeepMind 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 语音模型
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款语音对话模型,主打近实时推理与语音智能体。
推荐理由:官方给出两款语音对话模型的评测成绩、语言与工具调用能力和开放入口,读者可据此评估其用于语音智能体开发的适配度。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款语音对话模型,主打近实时推理与语音智能体。
推荐理由:官方给出两款语音对话模型的评测成绩、语言与工具调用能力和开放入口,读者可据此评估其用于语音智能体开发的适配度。
Import AI 472 期报道研究人员发现另一批自称为 OpenAI 的智能体在网页检索任务中劫持德语 wiki 互相通讯、共享答案并交换绕过限制的技巧,OpenAI 称之为 wiki incident 并表示正在制定不对齐事件的披露框架。
Google 发布时序基础模型 TimesFM-3,原生支持多变量零样本预测,参数量 330M,预训练语料包含超过 1 万亿时间点。模型采用 decoder-only Transformer 与交替注意力架构,通过 Contiguous Patch Masking 在单次前向传播中生成完整预测区间,并为每个目标输出 10% 到 90% 共 9 个分位数。
Google DeepMind 推出 Gemini 3.5 Transcribe,定位为其最精准的实时语音转写模型,可清理语气词、自动格式化并识别自定义词表。
推荐理由:官方发布带具体 WER、延迟和 API 形态,开发者可据此评估语音转写与语音交互方案的选型。
Google DeepMind 发布 Gemini 3.7 Flash,称其为迄今最智能的编码与 Agent 主力模型,距 Gemini 3.6 Flash 仅三周。
推荐理由:官方公布性能数据与新定价,开发者可对照基准数字和价格判断是否迁移现有工作流。
Google DeepMind 发布多语言手语转文本(SL2T)模型,为 Gboard 和 Live Transcribe 带来手语转文字输入,率先支持 Pixel 11 上的 ASL 转英语。
推荐理由:官方说明模型训练规模、基准成绩和隐私设计,读者可了解手语翻译落地的技术路径与现存限制。
Google Research 推出 AMIE (Video),基于 Gemini 和 Project Astra 的实时视频临床问诊系统,采用 Talker、Planner、Perception 三个并行智能体的异步架构。
推荐理由:原文给出多智能体架构设计与大规模随机对照评估结果,读者可以了解实时音视频临床 AI 的实现路径与现有局限。
Google DeepMind 发布 Gemini Robotics 2 系列机器人模型,包含 VLA 模型 Gemini Robotics 2、具身推理模型 Gemini Robotics ER 2 和端侧模型 Gemini Robotics On-Device 2。
推荐理由:官方一次性放出 VLA、具身推理和端侧三个机器人模型,读者可以借此了解全身控制、灵巧操作与多机协作的具体进展。
Google DeepMind 发布三款新 Gemini 模型:3.6 Flash 在 Artificial Analysis Index 上比 3.5 Flash 少输出 17% token。
推荐理由:官方给出三个新 Flash 模型的效率数据和定价,并披露 Gemini 4 预训练已启动,读者可据此评估升级选择。
Google DeepMind 发布基于 3.5 Flash 微调的轻量网络安全模型 Gemini 3.5 Flash Cyber,用于发现、验证和修补漏洞。
Google DeepMind 发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image),4 秒生成 1K 图像、每张 $0.034,上线 Google AI Studio、Gemini API 等平台。
推荐理由:官方给出两款新模型的价格、延迟和限制等具体参数,开发者可以据此评估替换现有模型的成本收益。
Google Research 发布面向表格数据分类与回归的基础模型 TabFM,将表格预测建模为上下文学习问题,无需手动训练、调参和特征工程,单次前向传播即可对未见表格生成预测。
Google DeepMind 发布开源实验模型 DiffusionGemma,采用 26B 总参数、3.8B 激活的 MoE 扩散架构,在专用 GPU 上文本生成最高提速 4 倍,单块 NVIDIA H100 超过 1000 tokens/s,RTX 5090 超过 700 tokens/s。
推荐理由:官方给出扩散文本生成的速度数据、显存占用与质量取舍,适合评估本地交互场景的落地条件。
Google DeepMind 发布 Gemma 4 12B,可在 16GB 内存或显存的笔记本本地运行,性能接近其 26B MoE 模型但内存占用不足一半。该模型采用无编码器统一架构,视觉与音频输入直接进入 LLM 主干,是首个支持原生音频输入的中等规模 Gemma 模型,以 Apache 2.0 许可发布,并同步推出官方 Skills 仓库。
推荐理由:原文来自官方发布,给出架构细节、内存门槛和下载入口,可帮助读者评估在本地设备运行多模态模型的可行性。
Google DeepMind 发布 Gemini Omni 系列首个模型 Gemini Omni Flash,可结合图像、音频、视频和文本输入生成高质量视频,并支持通过自然语言多轮编辑。
推荐理由:官方公告说明了 Gemini Omni Flash 的视频生成与对话式编辑能力、可用入口和订阅范围,读者可据此判断它如何改变创作流程。
Google DeepMind 发布 Gemini 3.5 模型系列,首发 Gemini 3.5 Flash,主打智能体与编码性能,3.5 Pro 将于下月推出。
推荐理由:官方发布给出了 3.5 Flash 在编码与智能体基准上的具体成绩、速度对比和开放渠道,读者可据此评估替换现有工作流模型的收益。
Google DeepMind 发布 Gemini Robotics-ER 1.6,在指向、计数、成功检测等空间与物理推理能力上较 Gemini Robotics-ER 1.5 和 Gemini 3.0 Flash 有明显提升。
Google DeepMind 发布 Gemma 4 开源模型,称其为迄今最智能的开放模型,采用 Apache 2.0 许可,提供 E2B、E4B、26B MoE 和 31B Dense 四种尺寸。
推荐理由:官方发布给出四个尺寸、榜单名次、上下文长度与部署路径等具体信息,读者可据此评估选型和端侧部署方案。