跳到正文
今天10月9日周五21 条
  1. Hugging Face Daily Papers42

    V-CoLA:面向线性注意力的视觉 Token 压缩方法

    V-CoLA 是一种免训练的视觉 Token 压缩框架,专为 Qwen3.5 等采用线性注意力的混合架构设计。它通过唯一性感知的重要性准则筛选关键视觉 Token,并配合自适应 Token 合并策略完成压缩。实验显示,仅保留 50.0% 视觉 Token 即可达到原性能的 99.5%,保留 12.5% 时仍超 88.0%,prefill 提速 1.86 至 6.15 倍。

  2. Hugging Face Daily Papers62

    TokenRouter:面向 token 级 LLM 路由的高效服务系统

    研究团队提出 TokenRouter,一个面向 token 级路由 LLM 推理的高效服务系统,采用以请求为中心的编程、以模型为中心的执行方式,为每个 LLM 启动子服务器并异步分发请求。其子服务器使用延迟批处理调度器,超参数由系统吞吐数学模型推导得出。在不同路由算法、负载和模型组合下,TokenRouter 的解码吞吐比现有系统高 2.01-64.15 倍,代码已在 GitHub 开源。

    推荐理由:论文给出 token 级路由的服务系统设计与吞吐对比,可了解细粒度路由落地的系统瓶颈与解法。

  3. Ollama Releases20

    Ollama v0.40.2 发布:旧模型后台自动升级至 llama.cpp

    Ollama v0.40.2 让旧版本下载的模型在首次运行时后台自动升级,以在 llama.cpp 上获得更好性能与兼容性,并保留原始副本作为备份以便安全降级。该版本还修复了 ollama list 对已升级模型重复显示的问题,ollama launch claude 现使用模型完整上下文长度。备份模型将在未来版本自动清除。

  4. AWS Machine Learning Blog38

    Cornerstone OnDemand 如何用 Amazon Bedrock 将数据库诊断时间缩短 78%

    Cornerstone OnDemand 基于 Amazon Bedrock 和 Strands Agents 构建多智能体系统 Orion AI,将数据库诊断时间从 45 分钟降至 10 分钟,减少 78%。该系统还把手动生命周期步骤从 10 步以上压缩为 1 次交互(减少 70%),并将冗余告警中位数削减 65%。三人团队用六个月完成交付。

  5. Claude Code Releases12

    Claude Code v2.1.295 发布

    Claude Code v2.1.295 为 command 和 HTTP hooks 新增 onFailure: "block",使无法启动、超时或异常退出的 hook 直接阻断操作;同时加入 Program Status Protocol(OSC 7501)支持,终端可显示 Claude Code 正在工作、等待用户还是已完成。

10月8日周四
  1. Google Developers Blog75

    Google 开源端侧 GPU 推理引擎 ML Drift

    Google AI Edge 团队以 Apache 2.0 协议开源端侧 GPU 计算引擎 ML Drift,它抽象 OpenGL ES、OpenCL、Metal 和 WebGPU,作为 LiteRT 的核心 GPU 加速引擎,也可独立使用。

    推荐理由:Google 开源端侧 GPU 推理引擎 ML Drift,并给出 Chrome、YouTube Shorts、Adobe 等迁移后的实测提速数据。

  2. Google Developers Blog71

    Google 发布 AQuA 环境质量智能体,诊断生产环境智能体故障

    Google 发布 AQuA(Ambient Quality Agent),一个在 Google Cloud 项目内旁路运行的质量智能体,按计划、部署后或按需扫描 Cloud Trace、Cloud Logging 或 BigQuery 中的生产轨迹,经采样、评审、聚类、验证、跟踪五阶段流水线输出可验证的故障洞察。

    推荐理由:原文给出 AQuA 的五阶段流水线、成本数据和一次真实多智能体排查案例,可据此判断生产环境智能体质量监控的可行做法。

  3. Hugging Face Blog76

    作者用 ML Intern 两天自建六个模型,总花费约 103 美元

    作者在 HuggingChat 中开启 ML-intern 模式,用提示词让它完成数据集构建、训练、评测和发布,两天内做出六个模型,总计算花费约 103 美元。

    推荐理由:作者用 ML Intern 在两天内从零训练并发布六个模型,给出了提示词写法与逐项算力花费,可迁移到自己的训练流程。

  4. GitHub Copilot Changelog60

    Claude Haiku 5.5 在 GitHub Copilot 正式可用

    Anthropic 最新的轻量模型 Claude Haiku 5.5 已在 GitHub Copilot 正式可用,面向 subagents、快速编辑和终端任务等高频场景。

    推荐理由:读者可以了解 Claude Haiku 5.5 在 GitHub Copilot 中的可用范围与计费方式,以及它在编码任务上的初步表现。

  5. NVIDIA Blog76

    NVIDIA 与 Microsoft 发布 RTX Spark 笔记本和 Windows 智能体基础设施

    在旧金山举行的 Windows AI and Surface 活动上,NVIDIA 与 Microsoft 宣布为 Windows PC 上的 AI 智能体共同设计软硬件,并公布 RTX Spark 笔记本即日开启预售、10 月 16 日开售,紧凑型台式机 11 月上市。

    推荐理由:英伟达与微软把智能体运行所需的系统级容器和本地算力硬件一起端出,读者可据此判断本地智能体落地的软硬件门槛。