跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

最新精选

第 41–59 条 · 共 59 条
9月5日周六
  1. GitHub Blog · AI & ML65

    GitHub Copilot 发布 Project HydraFusion 研究预览,通过多模型编排提升编码任务质量

    GitHub 推出 Project HydraFusion 研究预览,已在 GitHub Copilot CLI 中通过 /experimental 向所有 Copilot 套餐开放,按底层模型标准 token 费率计费。

    推荐理由:给出了多模型运行时编排的实现细节与三项智能体编码基准的成本与质量对比,可作为评估运行时调度思路取舍的参照。

9月3日周四
9月2日周三
  1. Google DeepMind68

    Gemini 推出 agentic 视频理解功能,最多可减少 88% token 消耗

    Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 中上线 agentic 视频理解功能,可将 token 消耗降低最多 88%、成本降低最多 66%,分析精度最高提升 7%。

    推荐理由:对比传统固定帧率处理方式,原文给出 token 消耗与精度的具体改进幅度,可作为评估新视频管线效果的参考。

8月31日周一
8月25日周二
  1. 智谱 GLM71

    智谱发布开源模型 GLM-5.3,强化编码与漏洞利用能力

    智谱发布开源模型 GLM-5.3,与 GLM-5.2 共享基座,全部增益来自后训练。在自研 Z.ai Code Bench 上较 GLM-5.2 提升 50%,并在 Terminal Bench 3.0、Agents' Last Exam、CyberGym 取得开源 SOTA。

    推荐理由:在同一份基准表中与八款模型横向打分,并附详细评测参数与防作弊设置,便于直接复现同口径对比。

  2. 智谱 GLM70

    智谱发布 GLM-5.3-Flash 多模态模型,320B 总参数 18B 激活

    智谱发布 GLM-5.3-Flash,是 GLM-5 系列首个原生多模态模型,总参数 320B、激活 18B,价格为 GLM-5.2 的十分之一,编码与智能体基准接近 Claude Opus 4.8。

    推荐理由:读者可以横向比较 GLM-5.3-Flash 与 Claude Opus 4.8 在编码与智能体基准上的差距,并参考其混合注意力与稀疏激活设计评估部署成本。

8月24日周一
  1. Qwen73

    千问开源 Qwen3.8-Flash-Next 模型,作为 Qwen4 架构实验预览

    千问(Qwen)在 Hugging Face 开源 Qwen3.8-Flash-Next 的 FP8 量化权重,称其为 Qwen4 架构的实验性预览版本。该模型总参数 125B、激活 6B,并附带 51B n-gram embedding 与 4B MTP,原生 262,144 tokens 上下文可通过 YaRN 扩展至 1,000,000 tokens。

    推荐理由:作为 Qwen4 架构的实验预览,文中给出的稀疏注意力与 N-gram 嵌入设计可与既有 MoE 路线横向对照。

8月20日周四
  1. Mistral AI63

    Mistral 发布 Agentic Search,为企业 AI 系统提供多步文档检索能力

    Mistral 发布 Agentic Search,作为面向企业 AI 系统的检索层,通过 search、open、navigate、read、grep 五个工具在现有索引上做多步查找、定位与验证,可通过 Mistral Search Toolkit 与 Libraries(Studio、Vibe)使用。

    推荐理由:原文用 FinanceBench 与 OfficeQA Pro 的具体数字把 Agentic Search 与传统一次性 RAG 做了直接对比,可据此判断检索层升级的实际收益。

8月13日周四
  1. DeepSeek76

    DeepSeek-V4-Pro 0813 正式发布,新增 DSpark 推测解码模块

    DeepSeek 正式发布 DeepSeek-V4-Pro 0813,在预览版基础上挂载 DSpark 推测解码模块,重点强化智能体能力。该模型在 HLE 上得分 42.7/60.0(无工具/有工具),Terminal Bench 2.1 达 87.9,DeepSWE 62.7。

    推荐理由:正文给出与同代模型的基准对比和 vLLM/SGLang 部署方式,读者可直接评估其相对位置并复现推理流程。

8月10日周一
  1. Hugging Face Blog74

    Meta 开源 30B 多模态模型 Muse Glimmer,主打本地智能体场景

    Meta 发布并开源 30B 多模态模型 Muse Glimmer(Apache 2.0),由 Muse 蒸馏而来,主打本地智能体场景,由 Hugging Face 在发布当日同步接入 transformers、llama.cpp、vLLM 与 Inference Endpoints,并支持基于 DFlash 的推测解码加速。

    推荐理由:原文汇总 30B 多模态模型的关键基准、DFlash 加速与同日多框架支持,便于评估其在本地智能体工作流中的可用性。

6月13日周六
  1. Kimi (Moonshot)79

    月之暗面开源发布 Kimi K3:2.8T 参数原生多模态智能体模型

    月之暗面(Kimi)发布开源原生多模态智能体模型 Kimi K3,总参数 2.8T、激活 104B,原生支持文本、图像与视频,配备 1M token 上下文窗口。

    推荐理由:Kimi K3 以 2.8T 参数和原生多模态设计开放权重,并在推理、编码与智能体多项基准上与 Claude Fable 5、GPT-5.6 Sol 等前沿模型直接对比,读者可据此查看其相对位置。

6月11日周四
5月27日周三
  1. 阶跃 StepFun66

    阶跃 StepFun 发布 198B 参数多模态模型 Step 3.7 Flash

    阶跃 StepFun 发布 Step 3.7 Flash 多模态模型,采用 198B 参数稀疏 MoE 架构,每 token 激活约 11B 参数,支持 256k 上下文与低中高三档可调推理强度,最高吞吐达 400 tokens/秒。

    推荐理由:Step 3.7 Flash 以 198B 稀疏 MoE 视觉语言模型形态发布,配合 256k 上下文与 ClawEval-1.1 67.1 的领先成绩,为 agent 与工具调用场景提供了从云端 API 到本地 GGUF 的完整部署参考。

5月23日周六
  1. 阶跃 StepFun62

    阶跃 StepFun 发布 198B 参数视觉语言模型 Step 3.7 Flash

    StepFun 发布 198B 参数稀疏 MoE 视觉语言模型 Step 3.7 Flash,每 token 激活约 11B 参数,吞吐量最高 400 tokens/s,支持 256k 上下文窗口与低/中/高三档推理强度。

    推荐理由:原文说明了该 198B MoE 模型针对高频生产与智能体工作流的定位,以及通过三档推理强度平衡成本与速度的设计取舍。

4月14日周二
  1. Kimi (Moonshot)74

    Kimi K2.6 开源发布:支持 300 子智能体协同,主打长程编码与原生多模态

    Kimi K2.6 开源发布,定位原生多模态智能体模型,重点强化长程编码、代码驱动的界面设计与 Agent Swarm 多智能体编排能力。模型采用 MoE 架构,总参数 1T、激活参数 32B、上下文长度 256K,可横向扩展至 300 个子智能体执行 4000 步协同任务,并在单次自主运行中产出文档、网页、表格等端到端结果。

    推荐理由:原文给出 K2.6 与 GPT-5.4、Claude Opus 4.6、Gemini 3.1 Pro 在 Agentic、编码、推理、视觉四类基准的多维对比,可作为开源前沿模型与闭源旗舰能力差距的一手参考。

4月9日周四
1月1日周四
11月4日周二
  1. Kimi (Moonshot)79

    月之暗面发布开源思考模型 Kimi K2 Thinking

    Kimi K2 Thinking 是月之暗面(Moonshot AI)发布的开源思考模型,采用 MoE 架构,总参数 1T、激活 32B,原生支持 256k 上下文与 INT4 量化推理。

    推荐理由:给出了K2 Thinking在推理、Agent搜索和代码任务上与GPT-5等多款主流模型的对照成绩,便于横向比较当前开源思考模型的水平。