Google Developers Blog·· 2026-08-26精选AI 评分60
Google Cloud 在 TPU 上为 vLLM 加入长上下文多模态嵌入推理支持
Enterprise-Grade Precision for Long-Context Multimodal Embedding Inference on Cloud TPU
AI 导读
Google Cloud 将原生 TPU 支持集成进 vLLM,并以 Qwen3-Embedding-8B 和 Qwen3-VL-Embedding-8B 为目标模型做了多项工程优化,支持 4K+ token 文本和 15K+ token 多模态输入。
推荐理由
原文给出 vLLM-TPU 上部署 Qwen3 嵌入模型的具体优化与开源配方,可了解长上下文多模态嵌入的工程路径。
来源:Google Developers Blog · developers.googleblog.com