ElevenLabs 发布 Eleven v4 语音模型,表现力与一致性提升并推出 Turbo 实时变体
ElevenLabs 发布新语音模型 Eleven v4,对音频标签的遵循更准确,单次支持最多 10,000 字符约十分钟音频,语言支持从约 70 种增至 90 种以上,发音基准得分从 v3 的 85.6% 升至 91.7%。
ElevenLabs 发布新语音模型 Eleven v4,对音频标签的遵循更准确,单次支持最多 10,000 字符约十分钟音频,语言支持从约 70 种增至 90 种以上,发音基准得分从 v3 的 85.6% 升至 91.7%。
Latent.Space 日报头条报道 TypeSafe 的 Jev 发布:一个用 RLCD 训练、只做决策分类路由打分而不生成文本的模型,宣称比小型前沿 LLM 快 20-200 倍、便宜 40-400 倍且输出 token 免费,社区认为适合替代生产系统中的结构化分类器、裁判和路由策略,但也提醒它需预定义输出格式、不能生成自由文本。
Hugging Face 推出 NeoMME 多语言多模态编码器家族,含 260M 和 800M 两个规模,用单个双向 Transformer 从头处理文本 token 和原始图像 patch,无需单独的预训练视觉塔或因果语言模型。
Microsoft Research 推出 GigaPath-Flash 和 GigaTIME-Flash 研究模型,以大幅提升病理学研究的计算效率。
Google DeepMind 推出 Gemini 3.5 Transcribe,定位为其最精准的实时语音转写模型,可清理语气词、自动格式化并识别自定义词表。
推荐理由:官方发布带具体 WER、延迟和 API 形态,开发者可据此评估语音转写与语音交互方案的选型。
Google DeepMind 发布多语言手语转文本(SL2T)模型,为 Gboard 和 Live Transcribe 带来手语转文字输入,率先支持 Pixel 11 上的 ASL 转英语。
推荐理由:官方说明模型训练规模、基准成绩和隐私设计,读者可了解手语翻译落地的技术路径与现存限制。
Google Research 推出 AMIE (Video),基于 Gemini 和 Project Astra 的实时视频临床问诊系统,采用 Talker、Planner、Perception 三个并行智能体的异步架构。
推荐理由:原文给出多智能体架构设计与大规模随机对照评估结果,读者可以了解实时音视频临床 AI 的实现路径与现有局限。
微软研究院发布研究模型 CARE-X,一个统一的胸部 X 光 VLM,结合生成式与判别式双推理,支持报告生成、疾病定位、多标签分类等多样临床解读任务。该模型采用 DAPO 强化学习在多任务设置中奖励临床正确性,并在 Narayana Health 的真实印度临床数据上验证。另一项独立实验将 Qwen3-VL-4B-Instruct 与确定性测量工具配对,评估直接计算能否提升测量依赖病灶的表现。
NVIDIA 发布 Magpie TTS Multilingual 开放权重模型,参数量 364M,新增现代标准阿拉伯语、韩语和巴西葡萄牙语,共支持 12 种语言,并提供生产级 NIM 部署容器。
推荐理由:原文给出TTFA延迟数据和架构改进细节,读者可据此评估自部署级联语音方案相对一体化语音模型的取舍。
Meta 于今日发布 Muse Glimmer,一个从 Muse 蒸馏而来的 30B 多模态开源模型,采用 Apache 2.0 许可,面向本地隐私敏感的 Agentic 场景如编码、文档分析和个人助手。
推荐理由:官方介绍可帮助读者了解这个 30B 本地多模态模型在 Agentic 基准上的表现与本地部署路径。
Mistral 发布 3B 开源权重多模态安全分类器 Shieldstral,将内容审核建模为策略自适应的问答任务,在推理时接受自然语言策略并输出校准的安全分数。该模型在文本安全上匹敌最大 7 倍于其体量的开放护栏模型,在多模态审核上创造新 SOTA,以 Apache 2.0 协议开放权重,可在单张 16GB GPU 上运行。
推荐理由:原文给出把内容审核改写成策略自适应问答的建模思路和数据构建方法,对做安全分类器的团队有可迁移的参考价值。
Google DeepMind 发布三款新 Gemini 模型:3.6 Flash 在 Artificial Analysis Index 上比 3.5 Flash 少输出 17% token。
推荐理由:官方给出三个新 Flash 模型的效率数据和定价,并披露 Gemini 4 预训练已启动,读者可据此评估升级选择。
DharmaOCR 在巴西葡萄牙语 OCR 基准上以 0.925 的得分领先新模型 Mistral OCR4(0.798)和 Unlimited-OCR(0.7587),证明领域专精的优势依然成立。该模型先通过葡萄牙语文档监督微调对齐词汇与文档结构,再用 DPO 从偏好数据中学习以降低输出退化率和推理成本。专项化训练使全部参数集中于单一语言,这一结构性取舍构成了对多语言模型的可量化优势。
Google DeepMind 发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image),4 秒生成 1K 图像、每张 $0.034,上线 Google AI Studio、Gemini API 等平台。
推荐理由:官方给出两款新模型的价格、延迟和限制等具体参数,开发者可以据此评估替换现有模型的成本收益。
Google DeepMind 发布 Gemma 4 12B,可在 16GB 内存或显存的笔记本本地运行,性能接近其 26B MoE 模型但内存占用不足一半。该模型采用无编码器统一架构,视觉与音频输入直接进入 LLM 主干,是首个支持原生音频输入的中等规模 Gemma 模型,以 Apache 2.0 许可发布,并同步推出官方 Skills 仓库。
推荐理由:原文来自官方发布,给出架构细节、内存门槛和下载入口,可帮助读者评估在本地设备运行多模态模型的可行性。
Mistral 将 Emmi AI 收入麾下,为企业级 AI 原生工业工程构建 physics AI 基础能力。这类数据驱动模型可从几何与边界条件直接预测物理行为,单 GPU 上一次前向传播数秒内输出完整物理场,替代传统 CFD/FEM 求解需数小时至数周的流程。已合作 ASML、Airbus、Safran、Siemens Energy 等伙伴,应用于产品设计、工装工艺设计和实时数字孪生。
Google DeepMind 发布 Gemini Omni 系列首个模型 Gemini Omni Flash,可结合图像、音频、视频和文本输入生成高质量视频,并支持通过自然语言多轮编辑。
推荐理由:官方公告说明了 Gemini Omni Flash 的视频生成与对话式编辑能力、可用入口和订阅范围,读者可据此判断它如何改变创作流程。
Google DeepMind 发布 Gemini Robotics-ER 1.6,在指向、计数、成功检测等空间与物理推理能力上较 Gemini Robotics-ER 1.5 和 Gemini 3.0 Flash 有明显提升。
Google DeepMind 发布 Gemma 4 开源模型,称其为迄今最智能的开放模型,采用 Apache 2.0 许可,提供 E2B、E4B、26B MoE 和 31B Dense 四种尺寸。
推荐理由:官方发布给出四个尺寸、榜单名次、上下文长度与部署路径等具体信息,读者可据此评估选型和端侧部署方案。
Mistral 发布 Mistral Small 4,是首个将 Magistral 推理、Pixtral 多模态和 Devstral 智能体编码能力统一到单一模型的小型旗舰,采用 Apache 2.0 许可开源。
推荐理由:原文给出架构参数、reasoning_effort 用法和与 GPT-OSS 120B 的输出效率对比,读者可据此评估部署成本与选型。
Mistral 发布新一代模型系列 Mistral 3,包含 Mistral Large 3(41B 激活、675B 总参数的 MoE)以及 3B、8B、14B 三档 Ministral 3 模型,全部以 Apache 2.0 许可开源。
推荐理由:官方一次放出 675B MoE 旗舰与三档小模型,全部 Apache 2.0 开源并给出部署路径,适合评估开源选型空间。