GitHub Copilot 发布 Project HydraFusion 研究预览,通过多模型编排提升编码任务质量
GitHub 推出 Project HydraFusion 研究预览,已在 GitHub Copilot CLI 中通过 /experimental 向所有 Copilot 套餐开放,按底层模型标准 token 费率计费。
推荐理由:给出了多模型运行时编排的实现细节与三项智能体编码基准的成本与质量对比,可作为评估运行时调度思路取舍的参照。
让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。
GitHub 推出 Project HydraFusion 研究预览,已在 GitHub Copilot CLI 中通过 /experimental 向所有 Copilot 套餐开放,按底层模型标准 token 费率计费。
推荐理由:给出了多模型运行时编排的实现细节与三项智能体编码基准的成本与质量对比,可作为评估运行时调度思路取舍的参照。
Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber 两款新模型,分别面向通用推理编码与网络安全防御。
推荐理由:同一价位下编码与推理能力相对前代明显提升,且同步给出安全专用版的基准与开放范围,读者可据此做选型对照。
Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 中上线 agentic 视频理解功能,可将 token 消耗降低最多 88%、成本降低最多 66%,分析精度最高提升 7%。
推荐理由:对比传统固定帧率处理方式,原文给出 token 消耗与精度的具体改进幅度,可作为评估新视频管线效果的参考。
DeepSeek 发布 V4 系列首个实验性多模态模型 DeepSeek-V4-Flash-Vision-Exp,在 V4-Flash 架构上加入视觉模块继续训练。
推荐理由:仓库同时给出与 Opus-4.8 的多模态 Agent 基准对比和开源推理实现,读者可据此判断它在 V4 系列里的相对位置。
IBM 发布 Granite 4.2 推理模型系列,提供 3B/8B/30B 三种 dense decoder-only 规格,以 Apache 2.0 开源。
推荐理由:详细拆解了 Granite 4.2 的架构与多阶段 RL 训练流程,包含 GRPO 异步训练和真实环境智能体 RL 设计,可作为开源推理模型训练方法参考。
智谱发布开源模型 GLM-5.3,与 GLM-5.2 共享基座,全部增益来自后训练。在自研 Z.ai Code Bench 上较 GLM-5.2 提升 50%,并在 Terminal Bench 3.0、Agents' Last Exam、CyberGym 取得开源 SOTA。
推荐理由:在同一份基准表中与八款模型横向打分,并附详细评测参数与防作弊设置,便于直接复现同口径对比。
智谱发布 GLM-5.3-Flash,是 GLM-5 系列首个原生多模态模型,总参数 320B、激活 18B,价格为 GLM-5.2 的十分之一,编码与智能体基准接近 Claude Opus 4.8。
推荐理由:读者可以横向比较 GLM-5.3-Flash 与 Claude Opus 4.8 在编码与智能体基准上的差距,并参考其混合注意力与稀疏激活设计评估部署成本。
千问(Qwen)在 Hugging Face 开源 Qwen3.8-Flash-Next 的 FP8 量化权重,称其为 Qwen4 架构的实验性预览版本。该模型总参数 125B、激活 6B,并附带 51B n-gram embedding 与 4B MTP,原生 262,144 tokens 上下文可通过 YaRN 扩展至 1,000,000 tokens。
推荐理由:作为 Qwen4 架构的实验预览,文中给出的稀疏注意力与 N-gram 嵌入设计可与既有 MoE 路线横向对照。
Mistral 发布 Agentic Search,作为面向企业 AI 系统的检索层,通过 search、open、navigate、read、grep 五个工具在现有索引上做多步查找、定位与验证,可通过 Mistral Search Toolkit 与 Libraries(Studio、Vibe)使用。
推荐理由:原文用 FinanceBench 与 OfficeQA Pro 的具体数字把 Agentic Search 与传统一次性 RAG 做了直接对比,可据此判断检索层升级的实际收益。
DeepSeek 正式发布 DeepSeek-V4-Pro 0813,在预览版基础上挂载 DSpark 推测解码模块,重点强化智能体能力。该模型在 HLE 上得分 42.7/60.0(无工具/有工具),Terminal Bench 2.1 达 87.9,DeepSWE 62.7。
推荐理由:正文给出与同代模型的基准对比和 vLLM/SGLang 部署方式,读者可直接评估其相对位置并复现推理流程。
Meta 发布并开源 30B 多模态模型 Muse Glimmer(Apache 2.0),由 Muse 蒸馏而来,主打本地智能体场景,由 Hugging Face 在发布当日同步接入 transformers、llama.cpp、vLLM 与 Inference Endpoints,并支持基于 DFlash 的推测解码加速。
推荐理由:原文汇总 30B 多模态模型的关键基准、DFlash 加速与同日多框架支持,便于评估其在本地智能体工作流中的可用性。
月之暗面(Kimi)发布开源原生多模态智能体模型 Kimi K3,总参数 2.8T、激活 104B,原生支持文本、图像与视频,配备 1M token 上下文窗口。
推荐理由:Kimi K3 以 2.8T 参数和原生多模态设计开放权重,并在推理、编码与智能体多项基准上与 Claude Fable 5、GPT-5.6 Sol 等前沿模型直接对比,读者可据此查看其相对位置。
Moonshot AI 发布 Kimi K2.7 Code 编码智能体模型,基于 K2.6 改进主打长周期编码端到端能力,思考 token 相比 K2.6 减少约 30%。
推荐理由:原文给出 K2.7 Code 相对 K2.6 的 token 效率改进,以及与 GPT-5.5、Opus 4.8 在编程和智能体基准上的对比数据。
阶跃 StepFun 发布 Step 3.7 Flash 多模态模型,采用 198B 参数稀疏 MoE 架构,每 token 激活约 11B 参数,支持 256k 上下文与低中高三档可调推理强度,最高吞吐达 400 tokens/秒。
推荐理由:Step 3.7 Flash 以 198B 稀疏 MoE 视觉语言模型形态发布,配合 256k 上下文与 ClawEval-1.1 67.1 的领先成绩,为 agent 与工具调用场景提供了从云端 API 到本地 GGUF 的完整部署参考。
StepFun 发布 198B 参数稀疏 MoE 视觉语言模型 Step 3.7 Flash,每 token 激活约 11B 参数,吞吐量最高 400 tokens/s,支持 256k 上下文窗口与低/中/高三档推理强度。
推荐理由:原文说明了该 198B MoE 模型针对高频生产与智能体工作流的定位,以及通过三档推理强度平衡成本与速度的设计取舍。
Kimi K2.6 开源发布,定位原生多模态智能体模型,重点强化长程编码、代码驱动的界面设计与 Agent Swarm 多智能体编排能力。模型采用 MoE 架构,总参数 1T、激活参数 32B、上下文长度 256K,可横向扩展至 300 个子智能体执行 4000 步协同任务,并在单次自主运行中产出文档、网页、表格等端到端结果。
推荐理由:原文给出 K2.6 与 GPT-5.4、Claude Opus 4.6、Gemini 3.1 Pro 在 Agentic、编码、推理、视觉四类基准的多维对比,可作为开源前沿模型与闭源旗舰能力差距的一手参考。
MiniMax 在 HuggingFace 发布 MiniMax-M2.7 模型,强调 Agent Teams、复杂 Skills 和动态工具搜索能力,并开放权重支持本地部署。
推荐理由:原文给出了与 Opus 4.6、GPT-5.4 等模型在多个工程基准上的横向对比,并附本地部署方式。
Moonshot AI 发布开源原生多模态智能体模型 Kimi K2.5,基于 Kimi-K2-Base 用约 15T 视觉和文本混合 token 继续预训练,支持即时与思考双模式及 Agent Swarm 协同执行。
推荐理由:原文给出 1T/32B MoE 架构与 256K 上下文的多模态智能体能力,并附与 GPT-5.2、Claude 4.5 Opus、Gemini 3 Pro 的横评。
Kimi K2 Thinking 是月之暗面(Moonshot AI)发布的开源思考模型,采用 MoE 架构,总参数 1T、激活 32B,原生支持 256k 上下文与 INT4 量化推理。
推荐理由:给出了K2 Thinking在推理、Agent搜索和代码任务上与GPT-5等多款主流模型的对照成绩,便于横向比较当前开源思考模型的水平。