跳到正文
  1. Hugging Face Daily Papers62

    TokenRouter:面向 token 级 LLM 路由的高效服务系统

    研究团队提出 TokenRouter,一个面向 token 级路由 LLM 推理的高效服务系统,采用以请求为中心的编程、以模型为中心的执行方式,为每个 LLM 启动子服务器并异步分发请求。其子服务器使用延迟批处理调度器,超参数由系统吞吐数学模型推导得出。在不同路由算法、负载和模型组合下,TokenRouter 的解码吞吐比现有系统高 2.01-64.15 倍,代码已在 GitHub 开源。

    推荐理由:论文给出 token 级路由的服务系统设计与吞吐对比,可了解细粒度路由落地的系统瓶颈与解法。

  2. Unsloth Releases62

    Unsloth 发布 v0.1.905-beta,新增跨平台沙箱与决策模型训练

    Unsloth 发布 v0.1.905-beta,为 Windows、Mac 和 Linux 引入沙箱机制,分别使用 MXC、Seatbelt 和 Bwrap 隔离模型运行的代码。

    推荐理由:Unsloth 新增跨平台沙箱与决策模型训练流程,读者可据此判断本地微调与部署的可用性变化。

  1. Google Developers Blog62

    Google 用 Tunix 在 TPU 上实现自主 LLM 后训练

    Google 发布 autofinetune 项目,把自主研究循环用于 LLM 后训练,基于 Tunix、Gemma 和 Cloud TPU,由 Antigravity CLI 与 Gemini Flash 3.7 编排。

    推荐理由:原文给出自主后训练循环的完整配置与两个真实案例,可据此迁移到自己的微调流程。

  1. Google Developers Blog60

    Google Cloud 在 TPU 上为 vLLM 加入长上下文多模态嵌入推理支持

    Google Cloud 将原生 TPU 支持集成进 vLLM,并以 Qwen3-Embedding-8B 和 Qwen3-VL-Embedding-8B 为目标模型做了多项工程优化,支持 4K+ token 文本和 15K+ token 多模态输入。

    推荐理由:原文给出 vLLM-TPU 上部署 Qwen3 嵌入模型的具体优化与开源配方,可了解长上下文多模态嵌入的工程路径。

已经到底了