GPT-6 推出改进版提示词缓存与监控工具
OpenAI 为 GPT-6 推出改进版提示词缓存系统,默认缓存命中率更高,对 30 分钟窗口内复用的前缀提供最高 90% 的输入 token 折扣。新增 Prompt Caching Dashboard、缓存诊断工具、显式缓存断点、推理力度调整推理不破坏缓存以及缓存预热等能力。
推荐理由:GPT-6 的缓存系统更新给出更高的默认命中率和监控工具,文中合作方数据可作为 Agent 类应用优化成本与延迟的参考。
让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。
OpenAI 为 GPT-6 推出改进版提示词缓存系统,默认缓存命中率更高,对 30 分钟窗口内复用的前缀提供最高 90% 的输入 token 折扣。新增 Prompt Caching Dashboard、缓存诊断工具、显式缓存断点、推理力度调整推理不破坏缓存以及缓存预热等能力。
推荐理由:GPT-6 的缓存系统更新给出更高的默认命中率和监控工具,文中合作方数据可作为 Agent 类应用优化成本与延迟的参考。
OpenAI 发布 GPT-6 家族的 GPT-6 Sol 与 GPT-6 Luna,API 定价较 GPT-5.6 促销价下调 50%,分别为 $2/$10 与 $0.10/$0.50(每百万 token)。
推荐理由:原文把 GPT-6 Sol 和 Luna 的 API 定价、缓存折扣以及在 AutomationBench、DeepSWE 等基准上与 Claude Opus 5、Fable 5.1 的成本-得分一并列出,便于同价位横向对照。
OpenAI 发布 Agents API,用于在云端构建和启动智能体的托管服务。该服务由 Codex harness 驱动,支持编排、长时会话和工具调用。
推荐理由:原文给出 Agents API 的核心能力边界和 Codex harness 底层,读者可据此评估对现有智能体工作流的替代价值。
GitHub 推出 Project HydraFusion 研究预览,已在 GitHub Copilot CLI 中通过 /experimental 向所有 Copilot 套餐开放,按底层模型标准 token 费率计费。
推荐理由:给出了多模型运行时编排的实现细节与三项智能体编码基准的成本与质量对比,可作为评估运行时调度思路取舍的参照。
Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber 两款新模型,分别面向通用推理编码与网络安全防御。
推荐理由:同一价位下编码与推理能力相对前代明显提升,且同步给出安全专用版的基准与开放范围,读者可据此做选型对照。
Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 中上线 agentic 视频理解功能,可将 token 消耗降低最多 88%、成本降低最多 66%,分析精度最高提升 7%。
推荐理由:对比传统固定帧率处理方式,原文给出 token 消耗与精度的具体改进幅度,可作为评估新视频管线效果的参考。
IBM 发布 Granite 4.2 推理模型系列,提供 3B/8B/30B 三种 dense decoder-only 规格,以 Apache 2.0 开源。
推荐理由:详细拆解了 Granite 4.2 的架构与多阶段 RL 训练流程,包含 GRPO 异步训练和真实环境智能体 RL 设计,可作为开源推理模型训练方法参考。
Mistral 发布 Agentic Search,作为面向企业 AI 系统的检索层,通过 search、open、navigate、read、grep 五个工具在现有索引上做多步查找、定位与验证,可通过 Mistral Search Toolkit 与 Libraries(Studio、Vibe)使用。
推荐理由:原文用 FinanceBench 与 OfficeQA Pro 的具体数字把 Agentic Search 与传统一次性 RAG 做了直接对比,可据此判断检索层升级的实际收益。
Meta 发布并开源 30B 多模态模型 Muse Glimmer(Apache 2.0),由 Muse 蒸馏而来,主打本地智能体场景,由 Hugging Face 在发布当日同步接入 transformers、llama.cpp、vLLM 与 Inference Endpoints,并支持基于 DFlash 的推测解码加速。
推荐理由:原文汇总 30B 多模态模型的关键基准、DFlash 加速与同日多框架支持,便于评估其在本地智能体工作流中的可用性。