Hugging Face Daily Papers·· 2 天前AI 评分53
SparseDecoding:面向解码的 LLM 剪枝框架
SparseDecoding: Decoding-Aware Pruning for Accurate and Efficient LLM Inference
AI 导读
SparseDecoding 提出一种面向解码阶段的剪枝框架,用稠密模型自回归生成(不含 prefill)时收集的逐层激活构建校准矩阵,使剪枝目标与解码激活对齐,并配套实现带 bitmask 索引与固定步长遍历的 N:M 稀疏矩阵向量内核。
来源:Hugging Face Daily Papers · huggingface.co