CrewAI 1.15.21 发布:新增 checkpoint 运行时与 CLI 使用遥测
CrewAI 发布 1.15.21,新增遥测以追踪 checkpoint 运行时和 CLI 使用情况。该版本修复了 HTTP 200 响应内上报的 gateway 错误、DashScope 模型改走原生 provider,并将 gpt-4o-mini 上下文窗口从 200000 更正为 128000。
CrewAI 发布 1.15.21,新增遥测以追踪 checkpoint 运行时和 CLI 使用情况。该版本修复了 HTTP 200 响应内上报的 gateway 错误、DashScope 模型改走原生 provider,并将 gpt-4o-mini 上下文窗口从 200000 更正为 128000。
OpenAI Agents SDK 发布 v0.22.2,新增支持当前图像生成工具选项,并修复 sandbox 中 UnixLocal 文件 API 的符号链接竞态问题。该版本还修复了 sessions 在 pop 后未重置 compaction 响应链的问题,并补充了 v0.22.1 行为变更文档。
TensorRT-LLM 发布 v1.3.0rc26,新增 DeepSeek-V4 Hopper、Qwen3.8-Flash-Next 支持,并在 B200 上启用 Kimi K3。
OpenAI Agents SDK 发布 v0.22.1,为 web search 工具新增图片结果支持,并支持自定义输出护栏的拦截消息。该版本还为 MCP 工具加入服务器级护栏,并为沙箱新增可配置的 Unix 本地环境隔离与 Docker 沙箱容器标签。此外修复了工具参数校验、会话恢复、语音流式转写与追踪等多项问题。
SGLang 发布 v0.5.19,合并 214 位贡献者的 786 个 PR,新增 Qwen3.8(2.4T-A95B)、Qwen3.8-27B、Ling-3.0-flash、Spark2.5、Granite 4.2 等模型支持。
CrewAI 发布 v1.15.20,修复了旧版平台工具别名发现(tool alias discovery)的问题,并更新了 v1.15.19 的快照与变更日志。该版本为不可变发布,仅发布标题和说明可修改,贡献者包括 @joaomdmoura 和 @vinibrsl。
CrewAI 发布 1.15.19,新增 Clipper 集成客户端,并在 CEL 表达式环境中加入 now()。该版本记录每次 crew 运行结束方式,机器规格改为按粗略档位而非核心数上报,同时为 CrewAI 平台工具加入可注入客户端。
LMDeploy 发布 v0.17.0,新增对 Kimi K2.6 和 DeepEPv2 的支持,并集成 mooncake store 作为 KV connector。该版本进一步优化 GLM-5.2 服务性能,在 CUDA 上为 paged attention 和 V4 prefill 引入 PDL,同时降低投机解码前后处理开销,并支持非 2 的幂次 page size。
MCP Servers 发布 v2026.8.31,更新了 @modelcontextprotocol/server-filesystem、server-memory、server-sequential-thinking 和 server-everything 四个包,版本号均为 2026.8.31。
微软研究院发布 GigaPath-Flash 和 GigaTIME-Flash,以蒸馏自十亿参数 GigaPath 编码器的 22M 参数 ViT-S 骨干替代原模型,在 PANDA 前列腺分级和 EBRAINS 脑肿瘤分型基准上以约 50 倍更少算力达到原 GigaPath 3% 以内的性能。
TensorRT-LLM v1.3.0rc25 将 KV cache manager V2 设为 DeepSeek V3/R1/V3 Lite、DeepSeek V3.2/V4。
DeepSpeed 发布 v0.19.6 补丁版本,新增 Apple Silicon(MPS)上的 ZeRO Stage 1-3 支持,并加入 Metal FusedAdam 内核与 CPU Adam 构建。
TRL v1.12.0 是 v1.11.0 的意外重复版本,两者在 PyPI 上的代码逐字节相同,没有任何新功能、修复或行为变化。
TRL v1.11.0 发布,其 vllm-serve 不再自建 FastAPI 服务,改为转发到 vLLM 原生 server,脚本从 1218 行降至约 130 行,权重同步改用 vLLM 的 NCCL weight-transfer 引擎。
SGLang 发布 v0.5.18,合并 212 位贡献者的 710 个 PR,新增 Muse Glimmer、Intern-S2-Mobius、SANA-Video、LTX-2.5、Cosmos3、LongCat-Image 等模型支持。
OpenAI Agents SDK 发布 v0.22.0,新增多项运行时加固并收紧现有 provider 配置约定:显式传入 openai_client 时,organization 或 project 必须迁移到 AsyncOpenAI 客户端。
LMDeploy 发布 v0.16.0,新增 GLM-5.2、Intern-S2-Mobius meta-MoE 与 Hy3 支持,并为 InternVL、Qwen VL 模型加入 TurboMind ViT 支持。
MCP Servers 发布 2026.8.18 版本,更新了 @modelcontextprotocol/server-everything、mcp-server-time、mcp-server-fetch 和 mcp-server-git 四个包,版本号均同步为 2026.8.18。
OpenAI Agents SDK 发布 v0.21.1,新增模型调用超时、run 级沙箱工作目录、Docker 沙箱禁用网络和 Modal 沙箱资源配置等能力。该版本还修复了精确调用审批、MultiProvider 子进程关闭、Chat Completions 推理重放及 SQLite 结构表冲突等问题。
TRL v1.10.0 将 DistillationTrainer 和 DistillationConfig 从 trl.experimental.distillation 升级为顶层稳定 API,导入方式与 SFT / DPO / GRPO / KTO 一致,旧路径仍可用但会发出 FutureWarning(v2.0.0 移除)。
TensorRT-LLM 发布 v1.3.0rc24,新增 Kimi K3(含 KDA kernel、优化 MoE、投机解码与分离式服务)、MiniCPM-V 4.6 图像视频支持,以及 PyTorch 后端的 Whisper 支持。
SGLang v0.5.17 发布,含 194 位贡献者的 582 个 PR,首日支持 2.8T 参数多模态模型 Kimi K3 和 MiniMax-H3 视频生成模型。
DeepSpeed 发布 v0.19.5 补丁版本,修复 ZeRO++ 小参数次级分片拷贝、AutoEP ZeRO-1/2 通用转换及 torch 2.12+ 编译错误等问题。该版本还默认启用 ZeRO-3 异步梯度卸载与固定内存卸载缓冲区,将原生主机内存固定拆分为独立的 pin_memory 算子,并恢复自定义 DCO 工作流。
DeepSpeed 发布 v0.19.4 补丁版本,为 ZeRO stage 0/1/2/3 加入 managed_gradient_accumulation 支持,并新增面向 Ampere/Ada 的 MoE 专家 Triton grouped-GEMM。
LMDeploy 发布 v0.15.0,新增 DeepSeek V4 支持,并支持长上下文与 MTP 前缀缓存命中。该版本为投机解码加入引导式解码支持,新增 AgRs all2all 后端与 memdecode 支持,同时优化 TTFT 并改进 Ascend-A3 多节点支持。
Berkeley AI Research 与 IBM Research 将 K-Search 进化式内核搜索框架扩展到 MLX,通过结构化 CUDA-to-MLX 翻译层把已有 CUDA 内核经验迁移到 Apple Silicon。
推荐理由:展示了把 CUDA 内核优化经验结构化迁移到 Apple Silicon 的方法,并给出注意力与 Mamba 两类内核的实测对比。
PEFT 发布 v0.20.0,一次性新增 HiRA、GLoRA、BEFT、MonteCLoRA、VeLoRA、Uni-LoRA、FRoD、MiCA、DEFT 九种参数高效微调方法,并新增面向图像生成方法的对比基准。
Model Context Protocol(MCP)发布 2026-07-28 候选版本(RC),规范以草案形式提供,详细变更见 2026-07-28 草案更新日志。该版本并非最终版,RC 与正式版之间可能仍有改动,各 SDK 将按自身节奏适配,旧版规范可能继续使用一段时间。客户端与服务器可通过版本协商文档确定所用协议版本。
Model Context Protocol(MCP)2026-07-28 修订版已作为稳定版发布,规范可在 MCP 官网查看。该版本的详细变更说明见 2026-07-28 changelog。
SGLang 发布 v0.5.16,包含 169 位贡献者的 574 个 PR。新投机解码算法 DSpark 在 DeepSeek-V4-Pro 上达到 383.7 tok/s,新增 975B 参数、1M token 上下文的 Inkling 多模态 MoE 模型支持。该版本还移除 QServe 与 FBGEMM FP8 量化路径,NVFP4 GEMM 现需 FlashInfer。
DeepSpeed 发布 v0.19.3 补丁版本,修复 ZeRO-3 在混合参数 dtype 下的 allgather 与 autocast 问题,并将 gradient_clipping 默认值设为 1.0、bf16 check_grad_overflow 默认开启。
Axolotl v0.18.0 发布,自 v0.17.0 以来累计超 90 次提交,主打低成本微调超大规模稀疏 MoE 模型。新增 NVFP4 MoE-LoRA,在 ScatterMoE 与 SonicMoE 后端支持 4-bit 专家 LoRA/QLoRA,4k 至 32k 上下文下显存占用近乎持平,并支持 GLM-5.2(DSA)2D 专家并行微调。
SGLang 发布 v0.5.15.post1 补丁版本,主要修复 GLM 5.2 相关问题。该版本修复了 GLM 5.2 IndexShare 在 PD 分离和 Context Parallel 设置下的问题,并解决了 flashinfer trtllm FP4 MoE kernel 在长输入下导致的 NaN 输出。
SGLang v0.5.15 发布,针对 Blackwell 调优的 GLM-5.2 NVFP4 在 8x B300 上实现 500+ tok/s/user、4x GB300 上 450 tok/s/user(bs=1)。
MCP Servers 发布 2026.7.10 版本,更新了 @modelcontextprotocol/server-filesystem、mcp-server-time、mcp-server-fetch 和 mcp-server-git 四个包至同一版本号。
MCP Servers 发布 2026.7.4 版本,更新了 @modelcontextprotocol/server-everything、server-filesystem、server-sequential-thinking 和 server-memory 四个包,版本号均同步至 2026.7.4。
LMDeploy 发布 v0.14.0,新增 FP8 KV cache 量化、Qwen3 Omni 支持,并在 turbomind 后端支持 Qwen3.5(vit)推理。该版本还加入 OpenAI Responses 兼容端点和 /get_ppl 接口,并扩展 chat completions 支持 token-in/out 与返回 routed experts。
Zed 发布 Hidden Gems 系列第四篇,介绍居中布局、多项目键盘导航、集成终端中设置 EDITOR 为 zed --wait、命令别名(command_aliases)以及用大纲面板紧凑浏览搜索结果等技巧。其中 command_aliases 可为命令面板中的任意命令定义单词别名,例如将 gd 映射到 git::Diff、gcp 映射到 git::CreatePullRequest。
DeepSpeed 发布 v0.19.2 补丁版本,新增 engine.coalesce_grad_reduction() 支持 ZeRO 1/2/3 多次反向传播,并加入 AutoEP 与 Biren SUPA 加速器支持。
MCP Servers 发布 2026.6.16 版本,由 actions-user 于 6 月 16 日打上标签。该版本随附 2 个资源文件,仓库当前有 202 个 issue 和 293 个 pull request。