跳到正文
LMDeploy Releases· lvhan028·· 2026-06-24AI 评分32

LMDeploy v0.14.0 发布:支持 Qwen3 Omni 与 FP8 KV cache 量化

v0.14.0

AI 导读

LMDeploy 发布 v0.14.0,新增 FP8 KV cache 量化、Qwen3 Omni 支持,并在 turbomind 后端支持 Qwen3.5(vit)推理。该版本还加入 OpenAI Responses 兼容端点和 /get_ppl 接口,并扩展 chat completions 支持 token-in/out 与返回 routed experts。

来源:LMDeploy Releases · github.com