Google DeepMind 发布 Gemini 4 Argon,主打编码与企业长链路任务
Google DeepMind 公布新一代前沿模型 Gemini 4 Argon,主打编码、企业知识工作(法律、金融)和网络安全防御等长链路任务。
推荐理由:原文同时披露了 Argon 在编码、企业知识工作与网络安全等长链路场景的关键基准成绩与定价,可供与同类前沿模型横向对比。
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
Google DeepMind 公布新一代前沿模型 Gemini 4 Argon,主打编码、企业知识工作(法律、金融)和网络安全防御等长链路任务。
推荐理由:原文同时披露了 Argon 在编码、企业知识工作与网络安全等长链路场景的关键基准成绩与定价,可供与同类前沿模型横向对比。
NVIDIA 发布开源表格基础模型 Kumo Tabular,在单次前向推理中完成表格分类与回归预测,无需训练或特征工程,权重与代码已在 Hugging Face 和 GitHub 开源。
推荐理由:原文同时给出架构细节与四项表格基准的排名结果,读者可以横向比较它在自身数据规模和列类型下是否值得替换现有方法。
Anthropic 发布 Claude Sonnet 5.5,运行速度提升 30% 以上、多数场景成本下降最多 30%,定价与 Sonnet 5 持平且基准表现优于 Sonnet 5。
推荐理由:作者对新版 Sonnet 做了实测并对比 OpenAI 免费档所用模型,可作为新版 Sonnet 的能力与选型参考。
Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS 两款语音生成模型,支持通过自然语言提示从零创建自定义声音、基于 30 秒样本复制人声,并提供 2000+ 现成声音库与 100+ 语言覆盖。
推荐理由:原文详细列出了两款新 TTS 模型的声音设计、复制与多语言能力,并给出 Hume AI 基准成绩,可对照此前 3.1 Flash TTS 评估实际提升幅度。
Google DeepMind 发布两款实时语音对话模型 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,前者兼顾成本与规模,后者面向高复杂度任务并支持边推理边说话。
推荐理由:原文给出了两款实时语音模型的多项基准成绩和面向开发者、企业的接入入口,读者可以据此对比现有同类方案的能力差异。
Google DeepMind 发布 WeatherNext 3 全球天气预报模型,引入实时地球同步卫星观测替代传统 NWP 数据,每小时更新并支持最高 5 公里分辨率。
推荐理由:WeatherNext 3 以实时卫星观测替代 NWP 数据训练,分辨率较前代提升约五倍,中等时效降水精度相对 IMERG 改善最高 60%。
OpenAI 发布开源模型系列 GPT OSS,包含 gpt-oss-120b 和 gpt-oss-20b 两个 MoE 模型,许可证为 Apache 2.0,主打推理与智能体任务。
推荐理由:详细梳理 GPT OSS 在 transformers、vLLM、llama.cpp 等推理框架下的部署配置与微调示例,附带可直接运行的代码片段。
Mistral AI 发布 Mistral Small 3.1,声称在小型模型类别中超越 Gemma 3 和 GPT-4o Mini。
推荐理由:作为 Apache 2.0 开源模型,Mistral Small 3.1 在多模态与长上下文维度声称超越 Gemma 3 和 GPT-4o Mini。