Google Gemini 4 Argon 缩小与 OpenAI、Anthropic 的差距但未明显领先
Google 发布 Gemini 4 Argon,是其自 Gemini 3.1 Pro 以来首个前沿模型。
Google 发布 Gemini 4 Argon,是其自 Gemini 3.1 Pro 以来首个前沿模型。
Cloudflare 发布两款自研开源决策模型 Clef 和 Clef-flash,托管在 Workers AI 上,在 Jev Decision Index 上领先现有模型,并以 Apache 2.0 协议开源至 Hugging Face。
Microsoft AI 发布 MAI-Transcribe-2-Streaming 实时转写模型与两款 MAI-Voice-2.1 语音合成模型,分别主打低延迟多语种转写和跨语种一致音色合成。
Tavus推出其称为首个"人机交互模型"(HIM)的Griffin,在1分钟视频通话后48%的参与者将其误认为真人,优于此前系统最高的2%。在Nvidia进行的音视频对话拟人度测试中,Griffin得分3.83,接近真人3.92,远高于此前最佳AI模型的2.80;轻量版Griffin-Lite已向部分测试者开放研究预览。
Ideogram 4.5 只改动用户指定区域而保持其他部分不变,相比 GPT-Image 2.5 和 Nano Banana 在多次编辑后更少产生伪影。该模型原生 2K 分辨率,提供四个质量档位,单张费用 0.8 至 22 美分,现已通过 Ideogram 平台与 API 上线,并与 Picsart、Runway、Pika、Leonardo AI 达成合作。
亚马逊云科技发布开源决策模型 Strands Decider 2B,基于 Qwen3.5-2B 构建,可在预设选项间快速选择并输出置信度分数。模型完全开源、可本地运行,由 Amazon 杰出工程师 Marc Brooker 主导、从其个人项目孵化而来,通过 Strands Labs 推出。OpenAI 同周推出同类产品,决策模型赛道涌入大量开源项目。
Google 发布新一代前沿模型 Gemini 4 Argon,声称在真实软件工程、法律和金融等企业知识工作以及网络安全防御上达到前沿水平,初期仅向一组"可信网络防御者"开放。
Google 发布 Gemini 4 Argon 模型,声称在编码、知识工作和网络安全上达到行业领先水平,但目前仅在 Google 内部有限测试,尚未对公众开放。
Google DeepMind 公布新一代前沿模型 Gemini 4 Argon,主打编码、企业知识工作(法律、金融)和网络安全防御等长链路任务。
推荐理由:原文同时披露了 Argon 在编码、企业知识工作与网络安全等长链路场景的关键基准成绩与定价,可供与同类前沿模型横向对比。
NVIDIA 发布开源表格基础模型 Kumo Tabular,在单次前向推理中完成表格分类与回归预测,无需训练或特征工程,权重与代码已在 Hugging Face 和 GitHub 开源。
推荐理由:原文同时给出架构细节与四项表格基准的排名结果,读者可以横向比较它在自身数据规模和列类型下是否值得替换现有方法。
Anthropic 发布 Claude Sonnet 5.5,运行速度提升 30% 以上、多数场景成本下降最多 30%,定价与 Sonnet 5 持平且基准表现优于 Sonnet 5。
推荐理由:作者对新版 Sonnet 做了实测并对比 OpenAI 免费档所用模型,可作为新版 Sonnet 的能力与选型参考。
Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS 两款语音生成模型,支持通过自然语言提示从零创建自定义声音、基于 30 秒样本复制人声,并提供 2000+ 现成声音库与 100+ 语言覆盖。
推荐理由:原文详细列出了两款新 TTS 模型的声音设计、复制与多语言能力,并给出 Hume AI 基准成绩,可对照此前 3.1 Flash TTS 评估实际提升幅度。
Google DeepMind 发布两款实时语音对话模型 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,前者兼顾成本与规模,后者面向高复杂度任务并支持边推理边说话。
推荐理由:原文给出了两款实时语音模型的多项基准成绩和面向开发者、企业的接入入口,读者可以据此对比现有同类方案的能力差异。
Google DeepMind 发布 WeatherNext 3 全球天气预报模型,引入实时地球同步卫星观测替代传统 NWP 数据,每小时更新并支持最高 5 公里分辨率。
推荐理由:WeatherNext 3 以实时卫星观测替代 NWP 数据训练,分辨率较前代提升约五倍,中等时效降水精度相对 IMERG 改善最高 60%。
OpenAI 发布开源模型系列 GPT OSS,包含 gpt-oss-120b 和 gpt-oss-20b 两个 MoE 模型,许可证为 Apache 2.0,主打推理与智能体任务。
推荐理由:详细梳理 GPT OSS 在 transformers、vLLM、llama.cpp 等推理框架下的部署配置与微调示例,附带可直接运行的代码片段。
Mistral AI 发布 Mistral Small 3.1,声称在小型模型类别中超越 Gemma 3 和 GPT-4o Mini。
推荐理由:作为 Apache 2.0 开源模型,Mistral Small 3.1 在多模态与长上下文维度声称超越 Gemma 3 和 GPT-4o Mini。
Mistral AI 发布文档理解 API Mistral OCR,输入图片和 PDF,输出有序的图文交错内容,已在 la Plateforme 上线,价格为 1000 pages/$,单节点最高可处理 2000 页/分钟。
推荐理由:原文附带与主流 OCR 模型的基准对比,读者可以据此横向判断其在多语言文档理解场景中的相对位置。
Mistral AI 发布 24B 参数区域语言模型 Mistral Saba,专为中东和南亚训练,支持阿拉伯语及多种印度源语言,泰米尔语等南印度语言表现尤其突出。官方称其准确率优于 5 倍规模的模型,推理速度超过 150 tokens/秒,可通过 API 或单 GPU 系统本地部署。典型场景包括阿拉伯语对话支持、专业领域微调和文化内容创作。