HF Daily Papers·· 2 天前精选AI 评分39
SparseDecoding:面向大语言模型解码的感知剪枝框架
SparseDecoding: Decoding-Aware Pruning for Accurate and Efficient LLM Inference
AI 导读
SparseDecoding 提出一种面向大语言模型解码阶段的感知剪枝框架,把校准数据改为模型自回归生成时的激活以对齐解码分布。
推荐理由
原文把剪枝校准对齐到解码阶段真实激活并搭配 SpMV 内核,给出 A100 上 1.48x 加速,可作为推理部署剪枝优化的参考。
来源:HF Daily Papers · huggingface.co