Cloudflare 发布 Clef 系列开源决策模型与 RL 微调平台
Cloudflare 发布两款自研开源决策模型 Clef 和 Clef-flash,托管在 Workers AI 上,在 Jev Decision Index 上领先现有模型,并以 Apache 2.0 协议开源至 Hugging Face。
Cloudflare 发布两款自研开源决策模型 Clef 和 Clef-flash,托管在 Workers AI 上,在 Jev Decision Index 上领先现有模型,并以 Apache 2.0 协议开源至 Hugging Face。
亚马逊云科技发布开源决策模型 Strands Decider 2B,基于 Qwen3.5-2B 构建,可在预设选项间快速选择并输出置信度分数。模型完全开源、可本地运行,由 Amazon 杰出工程师 Marc Brooker 主导、从其个人项目孵化而来,通过 Strands Labs 推出。OpenAI 同周推出同类产品,决策模型赛道涌入大量开源项目。
Google 发布 Gemini 4 Argon 模型,声称在编码、知识工作和网络安全上达到行业领先水平,但目前仅在 Google 内部有限测试,尚未对公众开放。
Google DeepMind 公布新一代前沿模型 Gemini 4 Argon,主打编码、企业知识工作(法律、金融)和网络安全防御等长链路任务。
推荐理由:原文同时披露了 Argon 在编码、企业知识工作与网络安全等长链路场景的关键基准成绩与定价,可供与同类前沿模型横向对比。
OpenAI 发布 GPT-6.1 Sol 模型,定位接近 Astra 智能水平,覆盖编码、计算机使用和专业工作场景,API 输入和输出 token 价格为 Astra 标准定价的五分之一。
OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna 两款模型,作为本月初发布的 GPT-6 Astra 的更经济版本,采用与 Astra 相似的训练方法延续其在专业工作、事实性、编码、计算机使用与协作风格上的能力提升。
推荐理由:给出 Sol 和 Luna 与 GPT-6 Astra 及 Claude Opus 5、Fable 5 等竞品在成本和能力上的对照数据,可作为评估企业级工作流性价比的参考。
Google DeepMind 发布两款实时语音对话模型 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,前者兼顾成本与规模,后者面向高复杂度任务并支持边推理边说话。
推荐理由:原文给出了两款实时语音模型的多项基准成绩和面向开发者、企业的接入入口,读者可以据此对比现有同类方案的能力差异。