Google 发布 Gemini 4 Argon,初期仅向可信网络防御者开放
Google 发布新一代前沿模型 Gemini 4 Argon,声称在真实软件工程、法律和金融等企业知识工作以及网络安全防御上达到前沿水平,初期仅向一组"可信网络防御者"开放。
Google 发布新一代前沿模型 Gemini 4 Argon,声称在真实软件工程、法律和金融等企业知识工作以及网络安全防御上达到前沿水平,初期仅向一组"可信网络防御者"开放。
Google 发布 Gemini 4 Argon 模型,声称在编码、知识工作和网络安全上达到行业领先水平,但目前仅在 Google 内部有限测试,尚未对公众开放。
Google DeepMind 公布新一代前沿模型 Gemini 4 Argon,主打编码、企业知识工作(法律、金融)和网络安全防御等长链路任务。
推荐理由:原文同时披露了 Argon 在编码、企业知识工作与网络安全等长链路场景的关键基准成绩与定价,可供与同类前沿模型横向对比。
OpenAI 发布 GPT-6.1 Sol 模型,定位接近 Astra 智能水平,覆盖编码、计算机使用和专业工作场景,API 输入和输出 token 价格为 Astra 标准定价的五分之一。
Anthropic 发布 Claude Sonnet 5.5,运行速度提升 30% 以上、多数场景成本下降最多 30%,定价与 Sonnet 5 持平且基准表现优于 Sonnet 5。
推荐理由:作者对新版 Sonnet 做了实测并对比 OpenAI 免费档所用模型,可作为新版 Sonnet 的能力与选型参考。
OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna 两款模型,作为本月初发布的 GPT-6 Astra 的更经济版本,采用与 Astra 相似的训练方法延续其在专业工作、事实性、编码、计算机使用与协作风格上的能力提升。
推荐理由:给出 Sol 和 Luna 与 GPT-6 Astra 及 Claude Opus 5、Fable 5 等竞品在成本和能力上的对照数据,可作为评估企业级工作流性价比的参考。
GitHub Copilot 应用内置 diff、终端和浏览器三大面板,让用户无需切换应用即可在同一界面完成 AI 代码改动的审查、运行与预览。diff 面板以绿/红色高亮新增与删除行,终端面板可直接运行项目命令,浏览器面板的 Pick & Polish 工具可对页面元素选中后迭代调整。
GitHub 推出 Project HydraFusion 研究预览,已在 GitHub Copilot CLI 中通过 /experimental 向所有 Copilot 套餐开放,按底层模型标准 token 费率计费。
推荐理由:给出了多模型运行时编排的实现细节与三项智能体编码基准的成本与质量对比,可作为评估运行时调度思路取舍的参照。
GitHub Copilot app 支持并行运行多个 AI Agent 会话,每个会话独立工作互不干扰。每条会话运行在独立的 Git worktree 上并各自保留上下文,切换时无需重新说明任务。
ScarfBench 是一个面向企业 Java 框架迁移的开源 AI 智能体评测基准,覆盖 Spring、Jakarta EE 与 Quarkus。基准包含 34 个应用、204 个迁移任务和 1,331 个专家测试,要求迁移后应用能够成功构建、部署并保持原有行为。
Datadog 采用 OpenAI 的 Codex 进行系统级代码审查。OpenAI 与 Datadog 联合发布品牌素材展示该用例场景。