V-CoLA:面向线性注意力的视觉 Token 压缩方法
V-CoLA 是一种免训练的视觉 Token 压缩框架,专为 Qwen3.5 等采用线性注意力的混合架构设计。它通过唯一性感知的重要性准则筛选关键视觉 Token,并配合自适应 Token 合并策略完成压缩。实验显示,仅保留 50.0% 视觉 Token 即可达到原性能的 99.5%,保留 12.5% 时仍超 88.0%,prefill 提速 1.86 至 6.15 倍。
V-CoLA 是一种免训练的视觉 Token 压缩框架,专为 Qwen3.5 等采用线性注意力的混合架构设计。它通过唯一性感知的重要性准则筛选关键视觉 Token,并配合自适应 Token 合并策略完成压缩。实验显示,仅保留 50.0% 视觉 Token 即可达到原性能的 99.5%,保留 12.5% 时仍超 88.0%,prefill 提速 1.86 至 6.15 倍。
SparseDecoding 提出一种面向解码阶段的剪枝框架,用稠密模型自回归生成(不含 prefill)时收集的逐层激活构建校准矩阵,使剪枝目标与解码激活对齐,并配套实现带 bitmask 索引与固定步长遍历的 N:M 稀疏矩阵向量内核。
研究团队提出 TokenRouter,一个面向 token 级路由 LLM 推理的高效服务系统,采用以请求为中心的编程、以模型为中心的执行方式,为每个 LLM 启动子服务器并异步分发请求。其子服务器使用延迟批处理调度器,超参数由系统吞吐数学模型推导得出。在不同路由算法、负载和模型组合下,TokenRouter 的解码吞吐比现有系统高 2.01-64.15 倍,代码已在 GitHub 开源。
推荐理由:论文给出 token 级路由的服务系统设计与吞吐对比,可了解细粒度路由落地的系统瓶颈与解法。
llama.cpp 发布 b11517 版本,CUDA 后端在调用 host MMQ 配置辅助函数时开始传递 src1 精度,并将 src1 精度参数改为显式传入。该改动由 ynankani 提交,对应 PR #30168。
llama.cpp 发布 b11506,server 在 slot 保存/恢复时保留上下文检查点,恢复后的 slot 可直接回滚到检查点,无需重新处理整个 prompt。
llama.cpp 发布 b11516,修复 Hexagon 后端 IM2COL patch-embed 的 DMA ring 溢出问题:精确 tiling(stride == kernel。
联想 YOGA Pro 15 RTX Spark 于 10 月 8 日 9:00 开启全网盲约,是全球首批搭载 NVIDIA RTX Spark N1X 超级芯片的本地智能体 AIPC。
Google Cloud 将原生 TPU 支持集成进 vLLM,并以 Qwen3-Embedding-8B 和 Qwen3-VL-Embedding-8B 为目标模型做了多项工程优化,支持 4K+ token 文本和 15K+ token 多模态输入。
推荐理由:原文给出 vLLM-TPU 上部署 Qwen3 嵌入模型的具体优化与开源配方,可了解长上下文多模态嵌入的工程路径。