V-CoLA:面向线性注意力的视觉 Token 压缩方法
V-CoLA 是一种免训练的视觉 Token 压缩框架,专为 Qwen3.5 等采用线性注意力的混合架构设计。它通过唯一性感知的重要性准则筛选关键视觉 Token,并配合自适应 Token 合并策略完成压缩。实验显示,仅保留 50.0% 视觉 Token 即可达到原性能的 99.5%,保留 12.5% 时仍超 88.0%,prefill 提速 1.86 至 6.15 倍。
V-CoLA 是一种免训练的视觉 Token 压缩框架,专为 Qwen3.5 等采用线性注意力的混合架构设计。它通过唯一性感知的重要性准则筛选关键视觉 Token,并配合自适应 Token 合并策略完成压缩。实验显示,仅保留 50.0% 视觉 Token 即可达到原性能的 99.5%,保留 12.5% 时仍超 88.0%,prefill 提速 1.86 至 6.15 倍。
SparseDecoding 提出一种面向解码阶段的剪枝框架,用稠密模型自回归生成(不含 prefill)时收集的逐层激活构建校准矩阵,使剪枝目标与解码激活对齐,并配套实现带 bitmask 索引与固定步长遍历的 N:M 稀疏矩阵向量内核。
研究团队提出 TokenRouter,一个面向 token 级路由 LLM 推理的高效服务系统,采用以请求为中心的编程、以模型为中心的执行方式,为每个 LLM 启动子服务器并异步分发请求。其子服务器使用延迟批处理调度器,超参数由系统吞吐数学模型推导得出。在不同路由算法、负载和模型组合下,TokenRouter 的解码吞吐比现有系统高 2.01-64.15 倍,代码已在 GitHub 开源。
推荐理由:论文给出 token 级路由的服务系统设计与吞吐对比,可了解细粒度路由落地的系统瓶颈与解法。
llama.cpp 发布 b11517 版本,CUDA 后端在调用 host MMQ 配置辅助函数时开始传递 src1 精度,并将 src1 精度参数改为显式传入。该改动由 ynankani 提交,对应 PR #30168。
研究者提出 CAFÉ,一种仅依赖已部署模型预测结果的机器遗忘黑盒测试方法,通过干预特征并将变化传播至下游特征,检测预测是否仍受目标特征影响。在两个因果网络基准、四种遗忘方法上,CAFÉ 以 0.92–0.93 的成对准确率对残余影响排序,现有检查最高仅 0.71。在真实人口普查数据上,CAFÉ 还发现了能通过重训练却未被直接输入检查察觉的残余影响。
研究提出在 Arm TrustZone 的 OP-TEE 中通过 WebAssembly Micro Runtime(WAMR)运行未经修改的 AI 模型,并配套一个加密 WebAssembly 二进制、将密钥存入设备熔丝的模型分发器,使只有 OP-TEE 中的 WAMR 可信应用能解密执行。
MAP4CS 是一个自适应数据剪枝框架,通过融合语法结构、语义多样性与分布表示,并配合规则过滤流程,从大规模代码语料中筛选出小型高质量核心子集。在两个大规模数据集上,它仅用 5% 训练数据即持续优于随机采样基线,性能可媲美甚至超过全量数据微调。分析显示,MAP4CS 能对冗余语料自动去重、对混乱语料自动去噪。
llama.cpp 发布 b11506,server 在 slot 保存/恢复时保留上下文检查点,恢复后的 slot 可直接回滚到检查点,无需重新处理整个 prompt。
llama.cpp 发布 b11516,修复 Hexagon 后端 IM2COL patch-embed 的 DMA ring 溢出问题:精确 tiling(stride == kernel。
联想 YOGA Pro 15 RTX Spark 于 10 月 8 日 9:00 开启全网盲约,是全球首批搭载 NVIDIA RTX Spark N1X 超级芯片的本地智能体 AIPC。
Unsloth 发布 v0.1.905-beta,为 Windows、Mac 和 Linux 引入沙箱机制,分别使用 MXC、Seatbelt 和 Bwrap 隔离模型运行的代码。
推荐理由:Unsloth 新增跨平台沙箱与决策模型训练流程,读者可据此判断本地微调与部署的可用性变化。
Google 发布 autofinetune 项目,把自主研究循环用于 LLM 后训练,基于 Tunix、Gemma 和 Cloud TPU,由 Antigravity CLI 与 Gemini Flash 3.7 编排。
推荐理由:原文给出自主后训练循环的完整配置与两个真实案例,可据此迁移到自己的微调流程。
Google Cloud 将原生 TPU 支持集成进 vLLM,并以 Qwen3-Embedding-8B 和 Qwen3-VL-Embedding-8B 为目标模型做了多项工程优化,支持 4K+ token 文本和 15K+ token 多模态输入。
推荐理由:原文给出 vLLM-TPU 上部署 Qwen3 嵌入模型的具体优化与开源配方,可了解长上下文多模态嵌入的工程路径。