跳到正文
今天10月9日周五6 条
  1. Hugging Face Daily Papers42

    V-CoLA:面向线性注意力的视觉 Token 压缩方法

    V-CoLA 是一种免训练的视觉 Token 压缩框架,专为 Qwen3.5 等采用线性注意力的混合架构设计。它通过唯一性感知的重要性准则筛选关键视觉 Token,并配合自适应 Token 合并策略完成压缩。实验显示,仅保留 50.0% 视觉 Token 即可达到原性能的 99.5%,保留 12.5% 时仍超 88.0%,prefill 提速 1.86 至 6.15 倍。

  2. Hugging Face Daily Papers62

    TokenRouter:面向 token 级 LLM 路由的高效服务系统

    研究团队提出 TokenRouter,一个面向 token 级路由 LLM 推理的高效服务系统,采用以请求为中心的编程、以模型为中心的执行方式,为每个 LLM 启动子服务器并异步分发请求。其子服务器使用延迟批处理调度器,超参数由系统吞吐数学模型推导得出。在不同路由算法、负载和模型组合下,TokenRouter 的解码吞吐比现有系统高 2.01-64.15 倍,代码已在 GitHub 开源。

    推荐理由:论文给出 token 级路由的服务系统设计与吞吐对比,可了解细粒度路由落地的系统瓶颈与解法。

  3. arXiv cs.SE24

    CAFÉ:机器遗忘的因果黑盒测试方法

    研究者提出 CAFÉ,一种仅依赖已部署模型预测结果的机器遗忘黑盒测试方法,通过干预特征并将变化传播至下游特征,检测预测是否仍受目标特征影响。在两个因果网络基准、四种遗忘方法上,CAFÉ 以 0.92–0.93 的成对准确率对残余影响排序,现有检查最高仅 0.71。在真实人口普查数据上,CAFÉ 还发现了能通过重训练却未被直接输入检查察觉的残余影响。

  4. arXiv cs.SE35

    MAP4CS:面向高效代码检索器微调的多维数据剪枝框架

    MAP4CS 是一个自适应数据剪枝框架,通过融合语法结构、语义多样性与分布表示,并配合规则过滤流程,从大规模代码语料中筛选出小型高质量核心子集。在两个大规模数据集上,它仅用 5% 训练数据即持续优于随机采样基线,性能可媲美甚至超过全量数据微调。分析显示,MAP4CS 能对冗余语料自动去重、对混乱语料自动去噪。