DeepSeek·· 24 天前精选AI 评分80
DeepSeek 发布 DeepSeek-V4.1-Flash,主打 KV cache 极限压缩
deepseek-ai/DeepSeek-V4.1-Flash
AI 导读
DeepSeek 发布多模态 MoE 模型 DeepSeek-V4.1-Flash,采用 CED 架构、CSA2 与 FP4 KV cache 等压缩手段,将全局 KV cache 占用压至每 token 890 字节,相对 DeepSeek-V4-Flash 和 DeepSeek-V1 分别缩减约 4 倍与 437 倍。
推荐理由
原文给出 CED 架构、CSA2 与 FP4 KV cache 等具体压缩设计,并对照 Opus-5.0、GPT-5.6 等前沿模型列出 agentic 基准成绩,读者可据此评估压缩策略对推理成本的实际收益。
来源:DeepSeek · huggingface.co