跳到正文
Hugging Face Daily Papers·· 2 天前AI 评分53

SparseDecoding:面向解码的 LLM 剪枝框架

SparseDecoding: Decoding-Aware Pruning for Accurate and Efficient LLM Inference

AI 导读

SparseDecoding 提出一种面向解码阶段的剪枝框架,用稠密模型自回归生成(不含 prefill)时收集的逐层激活构建校准矩阵,使剪枝目标与解码激活对齐,并配套实现带 bitmask 索引与固定步长遍历的 N:M 稀疏矩阵向量内核。

来源:Hugging Face Daily Papers · huggingface.co