LMDeploy v0.16.0 发布:支持 GLM-5.2、Intern-S2-Mobius 与 Hy3
LMDeploy 发布 v0.16.0,新增 GLM-5.2、Intern-S2-Mobius meta-MoE 与 Hy3 支持,并为 InternVL、Qwen VL 模型加入 TurboMind ViT 支持。
LMDeploy 发布 v0.16.0,新增 GLM-5.2、Intern-S2-Mobius meta-MoE 与 Hy3 支持,并为 InternVL、Qwen VL 模型加入 TurboMind ViT 支持。
Cursor 发布云智能体与 Cursor harness 更新,让常驻智能体可自动响应事件、保持目标并完成长会话任务。新增 Subscriptions 让云智能体监控 PR、Slack 线程或定时任务,并自动订阅自己创建的 PR 直至完成;子智能体可运行在各自独立的虚拟机环境中。此外还加入 Custom Modes、/goal 长周期目标指令,以及不打断智能体的 Steering 改进。
推荐理由:官方更新列出云智能体的订阅、目标保持与子智能体独立环境等能力,可据此判断常驻智能体工作流的变化。
MCP Servers 发布 2026.8.18 版本,更新了 @modelcontextprotocol/server-everything、mcp-server-time、mcp-server-fetch 和 mcp-server-git 四个包,版本号均同步为 2026.8.18。
Cursor 上线 Origin 代码托管,今日起面向所有付费方案开放早期 beta,企业组织管理员可选择退出。首批功能包括仓库、Pull Request、代码浏览和 GitHub 同步,Origin 托管的仓库以 Origin 为唯一来源,同步的 GitHub 仓库仍以 GitHub 为准,PR 评论双向同步。
推荐理由:Cursor 把代码托管、PR 与智能体放进同一入口,读者可据此判断它与 GitHub 的分工边界。
OpenAI Agents SDK 发布 v0.21.1,新增模型调用超时、run 级沙箱工作目录、Docker 沙箱禁用网络和 Modal 沙箱资源配置等能力。该版本还修复了精确调用审批、MultiProvider 子进程关闭、Chat Completions 推理重放及 SQLite 结构表冲突等问题。
OpenAI Agents SDK 发布 v0.21.0,新增 agents.testing、agents.realtime.testing 和 agents.voice.testing 工具,可在不发起 provider 请求的情况下对 Agent、Sandbox、Realtime 和 Voice 工作流做确定性测试。
TRL v1.10.0 将 DistillationTrainer 和 DistillationConfig 从 trl.experimental.distillation 升级为顶层稳定 API,导入方式与 SFT / DPO / GRPO / KTO 一致,旧路径仍可用但会发出 FutureWarning(v2.0.0 移除)。
Cursor 为 Cloud Agents 推出 Builds 功能,在后台预先准备已克隆仓库、装好依赖并跑完安装脚本的环境副本,智能体直接启动而无需每次从零配置,该功能不额外收费。
推荐理由:原文给出 Cloud Agents 环境预构建的机制与启动提速数据,可据此判断智能体启动流程的改动方式。
TensorRT-LLM 发布 v1.3.0rc24,新增 Kimi K3(含 KDA kernel、优化 MoE、投机解码与分离式服务)、MiniCPM-V 4.6 图像视频支持,以及 PyTorch 后端的 Whisper 支持。
Zed 团队发布 Delta,一个面向智能体编码与代码审阅的多人协作环境,首批用户已进入私测。Delta 基于自研 DeltaDB,将对话与 worktree 实时同步,兼容现有 git 仓库,评论可锚定到任意代码行并随代码演进;DeltaDB 还支持云端运行,关闭笔记本后智能体继续工作,并可通过链接在浏览器打开。
推荐理由:Zed 团队把 DeltaDB 的实时同步能力做成独立应用,读者可了解多人协作写代码与审阅智能体产出的新形态。
SGLang v0.5.17 发布,含 194 位贡献者的 582 个 PR,首日支持 2.8T 参数多模态模型 Kimi K3 和 MiniMax-H3 视频生成模型。
DeepSpeed 发布 v0.19.5 补丁版本,修复 ZeRO++ 小参数次级分片拷贝、AutoEP ZeRO-1/2 通用转换及 torch 2.12+ 编译错误等问题。该版本还默认启用 ZeRO-3 异步梯度卸载与固定内存卸载缓冲区,将原生主机内存固定拆分为独立的 pin_memory 算子,并恢复自定义 DCO 工作流。
DeepSpeed 发布 v0.19.4 补丁版本,为 ZeRO stage 0/1/2/3 加入 managed_gradient_accumulation 支持,并新增面向 Ampere/Ada 的 MoE 专家 Triton grouped-GEMM。
Zed 在 1.14 版本起为智能体面板的终端和 fetch 工具默认启用沙箱,由操作系统强制执行,默认禁止在项目目录外写入、写入 .git 以及发起网络请求,智能体需要时可申请临时提权并说明理由。
推荐理由:Zed 官方说明智能体沙箱的默认规则、权限升级流程与实现方式,并给出沙箱边界之外的攻击面清单。
LMDeploy 发布 v0.15.0,新增 DeepSeek V4 支持,并支持长上下文与 MTP 前缀缓存命中。该版本为投机解码加入引导式解码支持,新增 AgRs all2all 后端与 memdecode 支持,同时优化 TTFT 并改进 Ascend-A3 多节点支持。
PEFT 发布 v0.20.0,一次性新增 HiRA、GLoRA、BEFT、MonteCLoRA、VeLoRA、Uni-LoRA、FRoD、MiCA、DEFT 九种参数高效微调方法,并新增面向图像生成方法的对比基准。
Model Context Protocol(MCP)发布 2026-07-28 候选版本(RC),规范以草案形式提供,详细变更见 2026-07-28 草案更新日志。该版本并非最终版,RC 与正式版之间可能仍有改动,各 SDK 将按自身节奏适配,旧版规范可能继续使用一段时间。客户端与服务器可通过版本协商文档确定所用协议版本。
Model Context Protocol(MCP)2026-07-28 修订版已作为稳定版发布,规范可在 MCP 官网查看。该版本的详细变更说明见 2026-07-28 changelog。
SGLang 发布 v0.5.16,包含 169 位贡献者的 574 个 PR。新投机解码算法 DSpark 在 DeepSeek-V4-Pro 上达到 383.7 tok/s,新增 975B 参数、1M token 上下文的 Inkling 多模态 MoE 模型支持。该版本还移除 QServe 与 FBGEMM FP8 量化路径,NVFP4 GEMM 现需 FlashInfer。
DeepSpeed 发布 v0.19.3 补丁版本,修复 ZeRO-3 在混合参数 dtype 下的 allgather 与 autocast 问题,并将 gradient_clipping 默认值设为 1.0、bf16 check_grad_overflow 默认开启。
Sourcegraph 在 MCP server 中上线智能体搜索工具 Code Finder,它自行运行搜索循环,直接返回匹配的文件路径、行范围和用途说明。基准测试显示,Code Finder 比使用本地搜索工具的编程智能体快 2 倍以上,比调用其 MCP 工具的智能体成本低最多 40%,结果质量相当。该工具已通过 MCP 正式可用,并为 Deep Search 提供文件发现能力。
JetBrains Air 新版本通过 JetBrains 与 Zed 开发的 Agent Client Protocol(ACP)接入 GitHub Copilot、OpenCode、Pi、Cline 等兼容智能体,此前该工作流仅限 Air 自带的 Claude、Codex、Gemini CLI 和 Junie。
推荐理由:Air 通过 ACP 接入多家编码智能体并支持本地模型,读者可据此判断企业既有工具能否纳入同一工作流。
JetBrains 发布 JetBrains Context,一个为编码智能体构建语义索引并提供语义检索的仓库智能层,已随 JetBrains AI 订阅开放早期访问且不额外收费。
推荐理由:官方给出 JetBrains Context 的索引机制、接入方式与三项基准上的耗时成本降幅,可据此判断编码智能体的上下文方案。
Axolotl v0.18.0 发布,自 v0.17.0 以来累计超 90 次提交,主打低成本微调超大规模稀疏 MoE 模型。新增 NVFP4 MoE-LoRA,在 ScatterMoE 与 SonicMoE 后端支持 4-bit 专家 LoRA/QLoRA,4k 至 32k 上下文下显存占用近乎持平,并支持 GLM-5.2(DSA)2D 专家并行微调。
SGLang 发布 v0.5.15.post1 补丁版本,主要修复 GLM 5.2 相关问题。该版本修复了 GLM 5.2 IndexShare 在 PD 分离和 Context Parallel 设置下的问题,并解决了 flashinfer trtllm FP4 MoE kernel 在长输入下导致的 NaN 输出。
SGLang v0.5.15 发布,针对 Blackwell 调优的 GLM-5.2 NVFP4 在 8x B300 上实现 500+ tok/s/user、4x GB300 上 450 tok/s/user(bs=1)。
MCP Servers 发布 2026.7.10 版本,更新了 @modelcontextprotocol/server-filesystem、mcp-server-time、mcp-server-fetch 和 mcp-server-git 四个包至同一版本号。
MCP Servers 发布 2026.7.4 版本,更新了 @modelcontextprotocol/server-everything、server-filesystem、server-sequential-thinking 和 server-memory 四个包,版本号均同步至 2026.7.4。
LMDeploy 发布 v0.14.0,新增 FP8 KV cache 量化、Qwen3 Omni 支持,并在 turbomind 后端支持 Qwen3.5(vit)推理。该版本还加入 OpenAI Responses 兼容端点和 /get_ppl 接口,并扩展 chat completions 支持 token-in/out 与返回 routed experts。
CrewAI 在 CrewAI AMP 中新增 Databricks 托管集成,提供四个独立配置的 MCP server:Genie 负责自然语言问数、Databricks SQL 负责查询执行、Unity Catalog Functions 负责调用已注册业务逻辑、Vector Search 负责检索 Mosaic AI 向量索引。
DeepSpeed 发布 v0.19.2 补丁版本,新增 engine.coalesce_grad_reduction() 支持 ZeRO 1/2/3 多次反向传播,并加入 AutoEP 与 Biren SUPA 加速器支持。
MCP Servers 发布 2026.6.16 版本,由 actions-user 于 6 月 16 日打上标签。该版本随附 2 个资源文件,仓库当前有 202 个 issue 和 293 个 pull request。
LMDeploy 发布 v0.14.0a2,新增 FP8 KV cache 量化、Qwen3 Omni 支持,并在 turbomind 后端支持 Qwen3.5(vit)推理。该版本还加入 OpenAI Responses 兼容端点,扩展 chat completions 与 v1/messages 的 token 输入输出并返回 routed experts。
Zed 正在开发 DeltaDB,一种以细粒度 delta 取代 commit 的新型版本控制系统,可把与 AI 智能体的对话和其编辑的 worktree 一起版本化,beta 版将在几周内推出。
MCP Servers 发布 2026.6.3 版本,标签为 0e5f158。该版本由 actions-user 于 6 月 4 日打标签,发布资源共 2 项。
Axolotl v0.17.0 发布,新增基于 DeepEP 的 MoE 专家并行(EP)训练、BitNet 1.58-bit 全量微调,以及通过 Tinker 兼容 API 的远程训练。
LMDeploy 发布 v0.14.0a1,新增 FP8 KV cache 量化,并加入 Qwen3.5 MoE lite AWQ 支持。该版本扩展 chat completions 接口,支持 token-in/out 与返回 routed experts,并按 OpenAI 规范新增 AllowedToolChoice、解析失败返回 400。
LLaMA-Factory 发布 v0.9.5,新增对 Qwen3.5/Qwen3.6、Gemma 4 模型的主要支持,并兼容 Transformers v5。
smolagents 发布 v1.26.0,WebSearchTool 新增 Exa 作为搜索引擎选项,同时移除了远程 WasmExecutor。该版本还回滚了 ToolSerializer.dumps 的 f-string 转义修复,并更新了 LocalPythonExecutor 的 docstring。
DeepSpeed 发布 v0.19.1,新增 bf16 优化器状态 CPU offload 支持,并优化单例 MoE 通信、ZeRO-3 通过 mori 实现 SDMA allgather。该版本修复了 FastFileWriter 文件描述符泄漏、ZeRO-3 前向崩溃及 gemma4 注意力头等问题,同时支持 flash-attn 2.7.0 与 PyTorch v2.11 兼容。