跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

最新精选

第 21–29 条 · 共 29 条
9月23日周三
  1. OpenAI News65

    GPT-6 推出改进版提示词缓存与监控工具

    OpenAI 为 GPT-6 推出改进版提示词缓存系统,默认缓存命中率更高,对 30 分钟窗口内复用的前缀提供最高 90% 的输入 token 折扣。新增 Prompt Caching Dashboard、缓存诊断工具、显式缓存断点、推理力度调整推理不破坏缓存以及缓存预热等能力。

    推荐理由:GPT-6 的缓存系统更新给出更高的默认命中率和监控工具,文中合作方数据可作为 Agent 类应用优化成本与延迟的参考。

  2. OpenAI News76

    OpenAI 发布 GPT-6 Sol 与 GPT-6 Luna,API 价格较 GPT-5.6 下调 50%

    OpenAI 发布 GPT-6 家族的 GPT-6 Sol 与 GPT-6 Luna,API 定价较 GPT-5.6 促销价下调 50%,分别为 $2/$10 与 $0.10/$0.50(每百万 token)。

    推荐理由:原文把 GPT-6 Sol 和 Luna 的 API 定价、缓存折扣以及在 AutomationBench、DeepSWE 等基准上与 Claude Opus 5、Fable 5.1 的成本-得分一并列出,便于同价位横向对照。

9月10日周四
  1. OpenAI News62

    OpenAI 发布 Agents API

    OpenAI 发布 Agents API,用于在云端构建和启动智能体的托管服务。该服务由 Codex harness 驱动,支持编排、长时会话和工具调用。

    推荐理由:原文给出 Agents API 的核心能力边界和 Codex harness 底层,读者可据此评估对现有智能体工作流的替代价值。

9月5日周六
  1. GitHub Blog · AI & ML65

    GitHub Copilot 发布 Project HydraFusion 研究预览,通过多模型编排提升编码任务质量

    GitHub 推出 Project HydraFusion 研究预览,已在 GitHub Copilot CLI 中通过 /experimental 向所有 Copilot 套餐开放,按底层模型标准 token 费率计费。

    推荐理由:给出了多模型运行时编排的实现细节与三项智能体编码基准的成本与质量对比,可作为评估运行时调度思路取舍的参照。

9月3日周四
9月2日周三
  1. Google DeepMind68

    Gemini 推出 agentic 视频理解功能,最多可减少 88% token 消耗

    Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 中上线 agentic 视频理解功能,可将 token 消耗降低最多 88%、成本降低最多 66%,分析精度最高提升 7%。

    推荐理由:对比传统固定帧率处理方式,原文给出 token 消耗与精度的具体改进幅度,可作为评估新视频管线效果的参考。

8月25日周二
8月20日周四
  1. Mistral AI63

    Mistral 发布 Agentic Search,为企业 AI 系统提供多步文档检索能力

    Mistral 发布 Agentic Search,作为面向企业 AI 系统的检索层,通过 search、open、navigate、read、grep 五个工具在现有索引上做多步查找、定位与验证,可通过 Mistral Search Toolkit 与 Libraries(Studio、Vibe)使用。

    推荐理由:原文用 FinanceBench 与 OfficeQA Pro 的具体数字把 Agentic Search 与传统一次性 RAG 做了直接对比,可据此判断检索层升级的实际收益。

8月10日周一
  1. Hugging Face Blog74

    Meta 开源 30B 多模态模型 Muse Glimmer,主打本地智能体场景

    Meta 发布并开源 30B 多模态模型 Muse Glimmer(Apache 2.0),由 Muse 蒸馏而来,主打本地智能体场景,由 Hugging Face 在发布当日同步接入 transformers、llama.cpp、vLLM 与 Inference Endpoints,并支持基于 DFlash 的推测解码加速。

    推荐理由:原文汇总 30B 多模态模型的关键基准、DFlash 加速与同日多框架支持,便于评估其在本地智能体工作流中的可用性。