LMDeploy v0.15.0 发布:支持 DeepSeek V4 与 MTP 前缀缓存
LMDeploy 发布 v0.15.0,新增 DeepSeek V4 支持,并支持长上下文与 MTP 前缀缓存命中。该版本为投机解码加入引导式解码支持,新增 AgRs all2all 后端与 memdecode 支持,同时优化 TTFT 并改进 Ascend-A3 多节点支持。
LMDeploy 发布 v0.15.0,新增 DeepSeek V4 支持,并支持长上下文与 MTP 前缀缓存命中。该版本为投机解码加入引导式解码支持,新增 AgRs all2all 后端与 memdecode 支持,同时优化 TTFT 并改进 Ascend-A3 多节点支持。
PEFT 发布 v0.20.0,一次性新增 HiRA、GLoRA、BEFT、MonteCLoRA、VeLoRA、Uni-LoRA、FRoD、MiCA、DEFT 九种参数高效微调方法,并新增面向图像生成方法的对比基准。
Model Context Protocol(MCP)发布 2026-07-28 候选版本(RC),规范以草案形式提供,详细变更见 2026-07-28 草案更新日志。该版本并非最终版,RC 与正式版之间可能仍有改动,各 SDK 将按自身节奏适配,旧版规范可能继续使用一段时间。客户端与服务器可通过版本协商文档确定所用协议版本。
Model Context Protocol(MCP)2026-07-28 修订版已作为稳定版发布,规范可在 MCP 官网查看。该版本的详细变更说明见 2026-07-28 changelog。
SGLang 发布 v0.5.16,包含 169 位贡献者的 574 个 PR。新投机解码算法 DSpark 在 DeepSeek-V4-Pro 上达到 383.7 tok/s,新增 975B 参数、1M token 上下文的 Inkling 多模态 MoE 模型支持。该版本还移除 QServe 与 FBGEMM FP8 量化路径,NVFP4 GEMM 现需 FlashInfer。
DeepSpeed 发布 v0.19.3 补丁版本,修复 ZeRO-3 在混合参数 dtype 下的 allgather 与 autocast 问题,并将 gradient_clipping 默认值设为 1.0、bf16 check_grad_overflow 默认开启。
Sourcegraph 在 MCP server 中上线智能体搜索工具 Code Finder,它自行运行搜索循环,直接返回匹配的文件路径、行范围和用途说明。基准测试显示,Code Finder 比使用本地搜索工具的编程智能体快 2 倍以上,比调用其 MCP 工具的智能体成本低最多 40%,结果质量相当。该工具已通过 MCP 正式可用,并为 Deep Search 提供文件发现能力。
JetBrains Air 新版本通过 JetBrains 与 Zed 开发的 Agent Client Protocol(ACP)接入 GitHub Copilot、OpenCode、Pi、Cline 等兼容智能体,此前该工作流仅限 Air 自带的 Claude、Codex、Gemini CLI 和 Junie。
推荐理由:Air 通过 ACP 接入多家编码智能体并支持本地模型,读者可据此判断企业既有工具能否纳入同一工作流。
JetBrains 发布 JetBrains Context,一个为编码智能体构建语义索引并提供语义检索的仓库智能层,已随 JetBrains AI 订阅开放早期访问且不额外收费。
推荐理由:官方给出 JetBrains Context 的索引机制、接入方式与三项基准上的耗时成本降幅,可据此判断编码智能体的上下文方案。
Axolotl v0.18.0 发布,自 v0.17.0 以来累计超 90 次提交,主打低成本微调超大规模稀疏 MoE 模型。新增 NVFP4 MoE-LoRA,在 ScatterMoE 与 SonicMoE 后端支持 4-bit 专家 LoRA/QLoRA,4k 至 32k 上下文下显存占用近乎持平,并支持 GLM-5.2(DSA)2D 专家并行微调。
SGLang 发布 v0.5.15.post1 补丁版本,主要修复 GLM 5.2 相关问题。该版本修复了 GLM 5.2 IndexShare 在 PD 分离和 Context Parallel 设置下的问题,并解决了 flashinfer trtllm FP4 MoE kernel 在长输入下导致的 NaN 输出。
SGLang v0.5.15 发布,针对 Blackwell 调优的 GLM-5.2 NVFP4 在 8x B300 上实现 500+ tok/s/user、4x GB300 上 450 tok/s/user(bs=1)。
MCP Servers 发布 2026.7.10 版本,更新了 @modelcontextprotocol/server-filesystem、mcp-server-time、mcp-server-fetch 和 mcp-server-git 四个包至同一版本号。
MCP Servers 发布 2026.7.4 版本,更新了 @modelcontextprotocol/server-everything、server-filesystem、server-sequential-thinking 和 server-memory 四个包,版本号均同步至 2026.7.4。
LMDeploy 发布 v0.14.0,新增 FP8 KV cache 量化、Qwen3 Omni 支持,并在 turbomind 后端支持 Qwen3.5(vit)推理。该版本还加入 OpenAI Responses 兼容端点和 /get_ppl 接口,并扩展 chat completions 支持 token-in/out 与返回 routed experts。
CrewAI 在 CrewAI AMP 中新增 Databricks 托管集成,提供四个独立配置的 MCP server:Genie 负责自然语言问数、Databricks SQL 负责查询执行、Unity Catalog Functions 负责调用已注册业务逻辑、Vector Search 负责检索 Mosaic AI 向量索引。
DeepSpeed 发布 v0.19.2 补丁版本,新增 engine.coalesce_grad_reduction() 支持 ZeRO 1/2/3 多次反向传播,并加入 AutoEP 与 Biren SUPA 加速器支持。
MCP Servers 发布 2026.6.16 版本,由 actions-user 于 6 月 16 日打上标签。该版本随附 2 个资源文件,仓库当前有 202 个 issue 和 293 个 pull request。
LMDeploy 发布 v0.14.0a2,新增 FP8 KV cache 量化、Qwen3 Omni 支持,并在 turbomind 后端支持 Qwen3.5(vit)推理。该版本还加入 OpenAI Responses 兼容端点,扩展 chat completions 与 v1/messages 的 token 输入输出并返回 routed experts。
Zed 正在开发 DeltaDB,一种以细粒度 delta 取代 commit 的新型版本控制系统,可把与 AI 智能体的对话和其编辑的 worktree 一起版本化,beta 版将在几周内推出。
MCP Servers 发布 2026.6.3 版本,标签为 0e5f158。该版本由 actions-user 于 6 月 4 日打标签,发布资源共 2 项。
Axolotl v0.17.0 发布,新增基于 DeepEP 的 MoE 专家并行(EP)训练、BitNet 1.58-bit 全量微调,以及通过 Tinker 兼容 API 的远程训练。
LMDeploy 发布 v0.14.0a1,新增 FP8 KV cache 量化,并加入 Qwen3.5 MoE lite AWQ 支持。该版本扩展 chat completions 接口,支持 token-in/out 与返回 routed experts,并按 OpenAI 规范新增 AllowedToolChoice、解析失败返回 400。
LLaMA-Factory 发布 v0.9.5,新增对 Qwen3.5/Qwen3.6、Gemma 4 模型的主要支持,并兼容 Transformers v5。
smolagents 发布 v1.26.0,WebSearchTool 新增 Exa 作为搜索引擎选项,同时移除了远程 WasmExecutor。该版本还回滚了 ToolSerializer.dumps 的 f-string 转义修复,并更新了 LocalPythonExecutor 的 docstring。
DeepSpeed 发布 v0.19.1,新增 bf16 优化器状态 CPU offload 支持,并优化单例 MoE 通信、ZeRO-3 通过 mori 实现 SDMA allgather。该版本修复了 FastFileWriter 文件描述符泄漏、ZeRO-3 前向崩溃及 gemma4 注意力头等问题,同时支持 flash-attn 2.7.0 与 PyTorch v2.11 兼容。
smolagents 发布 v1.25.0,修复远程执行器的高危漏洞,并将 WasmExecutor 通配符绑定改为仅回环端点、为 Docker 与 Wasm 执行器引入 token 认证。该版本还移除旧版无前缀 pickle 支持、将 allow_pickle 默认设为 False,并新增 MLflow 集成文档与 Python 执行器参考页。
LMDeploy 发布 v0.13.0,新增 Anthropic 兼容服务端点,并支持 TurboQuant(quant_policy=42)的 KV Cache 量化。
PEFT 发布 v0.19.1 补丁版本,包含 #3161 和 #3165 两项修复。该版本由 BenjaminBossan 于 4 月 16 日发布,自上一版本以来主分支已有 325 次提交。
PEFT 发布 v0.19.0,一次性新增 GraLoRA、BD-LoRA、Cartridges、PVeRA、PSOFT、Lily、PEANuT、TinyLoRA、AdaMSS 共 9 种 PEFT 方法。
Axolotl 发布 v0.16.1,新增对 Gemma 4 的支持,并附带示例 YAML 配置。该版本自 v0.16.0 以来共合并 356 个提交,完整变更可通过 v0.16.0...v0.16.1 对比查看。
Axolotl 发布 v0.16.0,新增异步 GRPO 强化学习训练,集成 vLLM 并支持 LoRA 权重同步与 FP8,在 Qwen2-0.5B 上步时从 3.79s 降至 1.59s,提速 58%。
Axolotl 发布 v0.15.0,新增 GLM、Qwen3.5 及 Qwen3.5 MoE 模型支持,并引入 SonicMoE 内核与 ScatterMoE LoRA。
Axolotl 发布 v0.14.0,将底层 transformers 依赖从 v4 升级到 v5,并新增 MoE 内核选择(batched_mm、grouped_mm)及 scattermoe 自定义集成,显著提升 MoE 模型训练速度并降低显存占用。
MCP Servers 发布 v2026.1.26,更新了 @modelcontextprotocol/server-everything、@modelcontextprotocol/server-memory 和 mcp-server-time 三个包,版本号均为 2026.1.26。
smolagents 发布 v1.24.0,新增对 gpt-5.2* 系列模型的无停止序列支持,并为 Python 代码执行加入健壮的超时机制。该版本还兼容 Gradio 6,支持向 apply_chat_template 传递额外参数,并将 API 返回的工具调用统一转换为 smolagents 的 ChatMessageToolCall 格式。
MCP Servers 发布 v2026.1.14,更新了 @modelcontextprotocol/server-everything、@modelcontextprotocol/server-filesystem 和 mcp-server-git 三个服务包,版本号均为 2026.1.14。
PEFT 发布 0.18.1 补丁版本,为适配即将到来的 transformers v5 修复了若干特殊场景问题,并修复了此前无意要求 transformers >= 4.52 的回归问题。该版本还修复了在 AMD ROCm 上运行 PEFT 的问题。
LlamaFactory 发布 v0.9.4,仓库名从 LLaMA-Factory 改为 LlamaFactory,弃用 Python 3.9–3.10、要求 3.11–3.13,并从 pip 迁移到 uv 安装。
Model Context Protocol 发布 2025-11-25 修订版的稳定版本,规范已在 MCP 官网提供。该修订版的详细变更可查阅 2025-11-25 changelog。
推荐理由:MCP 2025-11-25 修订版转为稳定版,读者可据此确认协议版本状态并查阅变更清单。