V-CoLA:面向线性注意力的视觉 Token 压缩方法
V-CoLA 是一种免训练的视觉 Token 压缩框架,专为 Qwen3.5 等采用线性注意力的混合架构设计。它通过唯一性感知的重要性准则筛选关键视觉 Token,并配合自适应 Token 合并策略完成压缩。实验显示,仅保留 50.0% 视觉 Token 即可达到原性能的 99.5%,保留 12.5% 时仍超 88.0%,prefill 提速 1.86 至 6.15 倍。
V-CoLA 是一种免训练的视觉 Token 压缩框架,专为 Qwen3.5 等采用线性注意力的混合架构设计。它通过唯一性感知的重要性准则筛选关键视觉 Token,并配合自适应 Token 合并策略完成压缩。实验显示,仅保留 50.0% 视觉 Token 即可达到原性能的 99.5%,保留 12.5% 时仍超 88.0%,prefill 提速 1.86 至 6.15 倍。
SparseDecoding 提出一种面向解码阶段的剪枝框架,用稠密模型自回归生成(不含 prefill)时收集的逐层激活构建校准矩阵,使剪枝目标与解码激活对齐,并配套实现带 bitmask 索引与固定步长遍历的 N:M 稀疏矩阵向量内核。