跳到正文

推理能力

模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。

最新精选

第 21–30 条 · 共 30 条
8月25日周二
  1. 智谱 GLM69

    智谱发布开源模型 GLM-5.3,主打编码与漏洞利用能力提升

    智谱发布开源模型 GLM-5.3,能力提升全部来自对 GLM-5.2 的后训练,底层基础模型未变;自研 Z.ai Code Bench 较 GLM-5.2 提升 50%,Terminal Bench 3.0 和 Agents' Last Exam 取得开源 SOTA,CyberGym 漏洞发现达到 SOTA,漏洞利用类基准较 GLM-5.2 翻倍以上。

    推荐理由:原文列出了 GLM-5.3 在十余项编码与 Agent 基准上与闭源、开源模型的逐项分数,可作为评估开源前沿模型能力的对照参考。

8月24日周一
  1. Qwen73

    千问开源 Qwen3.8-Flash-Next 模型,作为 Qwen4 架构实验预览

    千问(Qwen)在 Hugging Face 开源 Qwen3.8-Flash-Next 的 FP8 量化权重,称其为 Qwen4 架构的实验性预览版本。该模型总参数 125B、激活 6B,并附带 51B n-gram embedding 与 4B MTP,原生 262,144 tokens 上下文可通过 YaRN 扩展至 1,000,000 tokens。

    推荐理由:作为 Qwen4 架构的实验预览,文中给出的稀疏注意力与 N-gram 嵌入设计可与既有 MoE 路线横向对照。

8月13日周四
  1. DeepSeek76

    DeepSeek-V4-Pro 0813 正式发布,新增 DSpark 推测解码模块

    DeepSeek 正式发布 DeepSeek-V4-Pro 0813,在预览版基础上挂载 DSpark 推测解码模块,重点强化智能体能力。该模型在 HLE 上得分 42.7/60.0(无工具/有工具),Terminal Bench 2.1 达 87.9,DeepSWE 62.7。

    推荐理由:正文给出与同代模型的基准对比和 vLLM/SGLang 部署方式,读者可直接评估其相对位置并复现推理流程。

6月16日周二
  1. 智谱 GLM72

    智谱发布 GLM-5.2 旗舰模型,主打 1M 上下文与多档推理强度

    智谱发布开源旗舰模型 GLM-5.2,主打 1M 上下文长程任务能力,并以 MIT 协议无地区限制开源。模型引入 IndexShare 稀疏注意力架构在 1M 上下文下将每 token FLOPs 减少 2.9 倍,并提供多档思考强度平衡性能与延迟;基准覆盖 HLE、SWE-bench Pro、MCP-Atlas、Terminal-Bench 2.1 等推理、代码与 Agentic 任务。

    推荐理由:原文同时给出 1M 上下文、IndexShare 架构细节和与多款前沿模型的横向基准分数,读者可以据此评估 GLM-5.2 在长程任务上的相对位置。

6月13日周六
  1. Kimi (Moonshot)79

    月之暗面开源发布 Kimi K3:2.8T 参数原生多模态智能体模型

    月之暗面(Kimi)发布开源原生多模态智能体模型 Kimi K3,总参数 2.8T、激活 104B,原生支持文本、图像与视频,配备 1M token 上下文窗口。

    推荐理由:Kimi K3 以 2.8T 参数和原生多模态设计开放权重,并在推理、编码与智能体多项基准上与 Claude Fable 5、GPT-5.6 Sol 等前沿模型直接对比,读者可据此查看其相对位置。

5月23日周六
  1. 阶跃 StepFun62

    阶跃 StepFun 发布 198B 参数视觉语言模型 Step 3.7 Flash

    StepFun 发布 198B 参数稀疏 MoE 视觉语言模型 Step 3.7 Flash,每 token 激活约 11B 参数,吞吐量最高 400 tokens/s,支持 256k 上下文窗口与低/中/高三档推理强度。

    推荐理由:原文说明了该 198B MoE 模型针对高频生产与智能体工作流的定位,以及通过三档推理强度平衡成本与速度的设计取舍。

4月14日周二
  1. Kimi (Moonshot)74

    Kimi K2.6 开源发布:支持 300 子智能体协同,主打长程编码与原生多模态

    Kimi K2.6 开源发布,定位原生多模态智能体模型,重点强化长程编码、代码驱动的界面设计与 Agent Swarm 多智能体编排能力。模型采用 MoE 架构,总参数 1T、激活参数 32B、上下文长度 256K,可横向扩展至 300 个子智能体执行 4000 步协同任务,并在单次自主运行中产出文档、网页、表格等端到端结果。

    推荐理由:原文给出 K2.6 与 GPT-5.4、Claude Opus 4.6、Gemini 3.1 Pro 在 Agentic、编码、推理、视觉四类基准的多维对比,可作为开源前沿模型与闭源旗舰能力差距的一手参考。

3月3日周二
1月1日周四
11月4日周二
  1. Kimi (Moonshot)79

    月之暗面发布开源思考模型 Kimi K2 Thinking

    Kimi K2 Thinking 是月之暗面(Moonshot AI)发布的开源思考模型,采用 MoE 架构,总参数 1T、激活 32B,原生支持 256k 上下文与 INT4 量化推理。

    推荐理由:给出了K2 Thinking在推理、Agent搜索和代码任务上与GPT-5等多款主流模型的对照成绩,便于横向比较当前开源思考模型的水平。