跳到正文
原文
DeepSeek·· 24 天前精选AI 评分80

DeepSeek 发布 DeepSeek-V4.1-Flash,主打 KV cache 极限压缩

deepseek-ai/DeepSeek-V4.1-Flash

AI 导读

DeepSeek 发布多模态 MoE 模型 DeepSeek-V4.1-Flash,采用 CED 架构、CSA2 与 FP4 KV cache 等压缩手段,将全局 KV cache 占用压至每 token 890 字节,相对 DeepSeek-V4-Flash 和 DeepSeek-V1 分别缩减约 4 倍与 437 倍。

推荐理由

原文给出 CED 架构、CSA2 与 FP4 KV cache 等具体压缩设计,并对照 Opus-5.0、GPT-5.6 等前沿模型列出 agentic 基准成绩,读者可据此评估压缩策略对推理成本的实际收益。

来源:DeepSeek · huggingface.co