跳到正文

公司与项目

vLLM 最新动态

vLLM 推理引擎的版本与性能动态:吞吐与显存优化、新模型支持、部署实践的持续追踪。

1 条精选近 30 天 0 条共收录 1 条

更新

vLLM的精选

8月26日周三第 1–1 条
  1. Google Developers Blog60

    Google Cloud 在 TPU 上为 vLLM 加入长上下文多模态嵌入推理支持

    Google Cloud 将原生 TPU 支持集成进 vLLM,并以 Qwen3-Embedding-8B 和 Qwen3-VL-Embedding-8B 为目标模型做了多项工程优化,支持 4K+ token 文本和 15K+ token 多模态输入。

    推荐理由:原文给出 vLLM-TPU 上部署 Qwen3 嵌入模型的具体优化与开源配方,可了解长上下文多模态嵌入的工程路径。