跳到正文
LMDeploy Releases· lvhan028·· 2026-06-01AI 评分20

LMDeploy v0.14.0a1 发布:新增 FP8 KV cache 量化

v0.14.0a1

AI 导读

LMDeploy 发布 v0.14.0a1,新增 FP8 KV cache 量化,并加入 Qwen3.5 MoE lite AWQ 支持。该版本扩展 chat completions 接口,支持 token-in/out 与返回 routed experts,并按 OpenAI 规范新增 AllowedToolChoice、解析失败返回 400。

来源:LMDeploy Releases · github.com