LMDeploy Releases· lvhan028·· 2026-06-24AI 评分32
LMDeploy v0.14.0 发布:支持 Qwen3 Omni 与 FP8 KV cache 量化
v0.14.0
AI 导读
LMDeploy 发布 v0.14.0,新增 FP8 KV cache 量化、Qwen3 Omni 支持,并在 turbomind 后端支持 Qwen3.5(vit)推理。该版本还加入 OpenAI Responses 兼容端点和 /get_ppl 接口,并扩展 chat completions 支持 token-in/out 与返回 routed experts。
来源:LMDeploy Releases · github.com