SGLang v0.5.16 发布:新增 DSpark 投机解码与 Inkling 模型支持
SGLang 发布 v0.5.16,包含 169 位贡献者的 574 个 PR。新投机解码算法 DSpark 在 DeepSeek-V4-Pro 上达到 383.7 tok/s,新增 975B 参数、1M token 上下文的 Inkling 多模态 MoE 模型支持。该版本还移除 QServe 与 FBGEMM FP8 量化路径,NVFP4 GEMM 现需 FlashInfer。
SGLang 发布 v0.5.16,包含 169 位贡献者的 574 个 PR。新投机解码算法 DSpark 在 DeepSeek-V4-Pro 上达到 383.7 tok/s,新增 975B 参数、1M token 上下文的 Inkling 多模态 MoE 模型支持。该版本还移除 QServe 与 FBGEMM FP8 量化路径,NVFP4 GEMM 现需 FlashInfer。
DeepSpeed 发布 v0.19.3 补丁版本,修复 ZeRO-3 在混合参数 dtype 下的 allgather 与 autocast 问题,并将 gradient_clipping 默认值设为 1.0、bf16 check_grad_overflow 默认开启。
JetBrains Air 新版本通过 JetBrains 与 Zed 开发的 Agent Client Protocol(ACP)接入 GitHub Copilot、OpenCode、Pi、Cline 等兼容智能体,此前该工作流仅限 Air 自带的 Claude、Codex、Gemini CLI 和 Junie。
推荐理由:Air 通过 ACP 接入多家编码智能体并支持本地模型,读者可据此判断企业既有工具能否纳入同一工作流。
JetBrains 发布 JetBrains Context,一个为编码智能体构建语义索引并提供语义检索的仓库智能层,已随 JetBrains AI 订阅开放早期访问且不额外收费。
推荐理由:官方给出 JetBrains Context 的索引机制、接入方式与三项基准上的耗时成本降幅,可据此判断编码智能体的上下文方案。
Axolotl v0.18.0 发布,自 v0.17.0 以来累计超 90 次提交,主打低成本微调超大规模稀疏 MoE 模型。新增 NVFP4 MoE-LoRA,在 ScatterMoE 与 SonicMoE 后端支持 4-bit 专家 LoRA/QLoRA,4k 至 32k 上下文下显存占用近乎持平,并支持 GLM-5.2(DSA)2D 专家并行微调。
SGLang 发布 v0.5.15.post1 补丁版本,主要修复 GLM 5.2 相关问题。该版本修复了 GLM 5.2 IndexShare 在 PD 分离和 Context Parallel 设置下的问题,并解决了 flashinfer trtllm FP4 MoE kernel 在长输入下导致的 NaN 输出。
Veracode 测试超 100 个大语言模型发现 45% 的 AI 生成代码样本未通过安全测试,Apiiro 的 Fortune 50 研究显示 AI 辅助开发者的提交量增加 3 至 4 倍、团队安全问题数增加 10 倍。
SGLang v0.5.15 发布,针对 Blackwell 调优的 GLM-5.2 NVFP4 在 8x B300 上实现 500+ tok/s/user、4x GB300 上 450 tok/s/user(bs=1)。
伯克利 EPIC Data Lab 提出,随着推理成本从 2023 年初 GPT-4 级约 $30/百万 token 降至如今不到 $1、部分低于 $0.10,数据系统面临三大新挑战:为智能体设计(Data Systems For Agents)、运行智能体(Of Agents)、由智能体构建(By Agents)。
LMDeploy 发布 v0.14.0,新增 FP8 KV cache 量化、Qwen3 Omni 支持,并在 turbomind 后端支持 Qwen3.5(vit)推理。该版本还加入 OpenAI Responses 兼容端点和 /get_ppl 接口,并扩展 chat completions 支持 token-in/out 与返回 routed experts。
Zed 发布 Hidden Gems 系列第四篇,介绍居中布局、多项目键盘导航、集成终端中设置 EDITOR 为 zed --wait、命令别名(command_aliases)以及用大纲面板紧凑浏览搜索结果等技巧。其中 command_aliases 可为命令面板中的任意命令定义单词别名,例如将 gd 映射到 git::Diff、gcp 映射到 git::CreatePullRequest。
CrewAI 在 CrewAI AMP 中新增 Databricks 托管集成,提供四个独立配置的 MCP server:Genie 负责自然语言问数、Databricks SQL 负责查询执行、Unity Catalog Functions 负责调用已注册业务逻辑、Vector Search 负责检索 Mosaic AI 向量索引。
DeepSpeed 发布 v0.19.2 补丁版本,新增 engine.coalesce_grad_reduction() 支持 ZeRO 1/2/3 多次反向传播,并加入 AutoEP 与 Biren SUPA 加速器支持。
LMDeploy 发布 v0.14.0a2,新增 FP8 KV cache 量化、Qwen3 Omni 支持,并在 turbomind 后端支持 Qwen3.5(vit)推理。该版本还加入 OpenAI Responses 兼容端点,扩展 chat completions 与 v1/messages 的 token 输入输出并返回 routed experts。
Zed 正在开发 DeltaDB,一种以细粒度 delta 取代 commit 的新型版本控制系统,可把与 AI 智能体的对话和其编辑的 worktree 一起版本化,beta 版将在几周内推出。
CrewAI 提出"受治理编排"模式,让智能体跨系统协同工作,同时由平台从设计之初就承载治理能力。该模式结合 Snowflake 的权限模型与数据血缘,以及 CrewAI 的构建与运行时层,使智能体在不突破企业信任边界的前提下规模化运行。
Axolotl v0.17.0 发布,新增基于 DeepEP 的 MoE 专家并行(EP)训练、BitNet 1.58-bit 全量微调,以及通过 Tinker 兼容 API 的远程训练。
LMDeploy 发布 v0.14.0a1,新增 FP8 KV cache 量化,并加入 Qwen3.5 MoE lite AWQ 支持。该版本扩展 chat completions 接口,支持 token-in/out 与返回 routed experts,并按 OpenAI 规范新增 AllowedToolChoice、解析失败返回 400。
LLaMA-Factory 发布 v0.9.5,新增对 Qwen3.5/Qwen3.6、Gemma 4 模型的主要支持,并兼容 Transformers v5。
DeepSpeed 发布 v0.19.1,新增 bf16 优化器状态 CPU offload 支持,并优化单例 MoE 通信、ZeRO-3 通过 mori 实现 SDMA allgather。该版本修复了 FastFileWriter 文件描述符泄漏、ZeRO-3 前向崩溃及 gemma4 注意力头等问题,同时支持 flash-attn 2.7.0 与 PyTorch v2.11 兼容。
CrewAI 的多智能体系统帮一家头部金融科技公司将每周合规报告生成时间从 16 小时(两天)压缩到不足 2 小时,单份报告周转时间减少 87%。该系统由自动提取五个内部系统数据的 Flow 与分析 Crew 组成,智能体分别负责汇总合规指标、撰写叙述并由协调者整合成报告,同时保留历史记忆与合规护栏。该团队在看到结果后签下六位数合同。
CrewAI 为一家年处理 15000+ 告警工单的中型全球企业 SaaS 厂商部署五智能体工作流,实现 Level 1 工单分诊全自动化,平均首次响应稳定在 20 分钟,满足 45 分钟合同 SLA。
LMDeploy 发布 v0.13.0,新增 Anthropic 兼容服务端点,并支持 TurboQuant(quant_policy=42)的 KV Cache 量化。
伯克利 AI 研究团队梳理了并行推理领域进展,指出当前多数方法(如 Self-consistency、Best-of-N、Tree of Thoughts、MCTS、ParaThinker、GroupThink、Hogwild!
CrewAI 的智能体架构帮助一家医疗机构将护士每日录入时间从 12 小时降至约 2.4 小时,减少 80%。该工作流由 Intake Reader、Insurance Eligibility、Routing、Orchestrator 等专职智能体分工协作,并配有 Validation Guardrails 监控准确性与合规性。
CrewAI 用三个专职智能体加一个编排器,为一家日均处理 5 万订单的电商公司自动化退货退款流程:请求分类、订单与政策核验、回复草拟,复杂案件才转人工。该方案目标是将退货处理人员减少 60%、每年节省超 120 万美元,请求处理速度提升一倍。
PEFT 发布 v0.19.0,一次性新增 GraLoRA、BD-LoRA、Cartridges、PVeRA、PSOFT、Lily、PEANuT、TinyLoRA、AdaMSS 共 9 种 PEFT 方法。
CrewAI 为一家全球饮料企业重建每周需求预测流程,用六个专职 AI 智能体组成自主工作流,分别负责编排、从 SAP S/4HANA 和 Databricks 取数、清洗、SKU 级预测、异常识别和报告生成。部署周期从约一个月缩短到两周,实现约 90% 自动化,原本五名分析师每周 40 小时的数据整理工作降至分钟级,代码与模型更新可在 30 分钟内上线。
Axolotl 发布 v0.16.0,新增异步 GRPO 强化学习训练,集成 vLLM 并支持 LoRA 权重同步与 FP8,在 Qwen2-0.5B 上步时从 3.79s 降至 1.59s,提速 58%。
随着 Claude Code 等 AI 智能体并行写代码,代码库正变成无人阅读的"只写代码",Brown 教授 Shriram Krishnamurthi 发现其生成的 bookstore 应用存在用浮点数算钱、自造 CSV 解析器等问题。
Axolotl 发布 v0.15.0,新增 GLM、Qwen3.5 及 Qwen3.5 MoE 模型支持,并引入 SonicMoE 内核与 ScatterMoE LoRA。
Continue 提出,AI 生成代码引发的低质问题应归因于流程缺失而非开发者个人。采用 AI 辅助编码的团队 PR 提交量提升 2-5 倍,但代码从 agent 到合并缺乏标准强制检查,无人拦截缺失的限流、输入校验等问题。Continue 将团队标准写成仓库中的 markdown 检查文件,每个 PR 上以完整 agent 运行,通过则静默、失败则给出具体问题和修复建议。
一位开发者用 8 波、每波 4 个并行 Claude Code 会话(各自独立 git worktree、先规划后构建),一天内合并 29 个 PR,净增 283 行代码(新增 3,917、删除 3,634),每个 PR 通过 27 项 AI 检查。
Continue 提出在 vibe coding 之后增加“Chiseling(凿刻)”环节,即人工重构和打磨 AI 生成的代码,把重复功能、1000 行方法和无用单测清理成清晰的逻辑核心。团队规模扩大后,凿刻会成为瓶颈,因此需要在 CI/CD 中引入云端智能体自动检查命名、抽象、测试与安全规范,把资深工程师的打磨标准编码为对每个 PR 的系统化审查。
Axolotl 发布 v0.14.0,将底层 transformers 依赖从 v4 升级到 v5,并新增 MoE 内核选择(batched_mm、grouped_mm)及 scattermoe 自定义集成,显著提升 MoE 模型训练速度并降低显存占用。
PEFT 发布 0.18.1 补丁版本,为适配即将到来的 transformers v5 修复了若干特殊场景问题,并修复了此前无意要求 transformers >= 4.52 的回归问题。该版本还修复了在 AMD ROCm 上运行 PEFT 的问题。
LlamaFactory 发布 v0.9.4,仓库名从 LLaMA-Factory 改为 LlamaFactory,弃用 Python 3.9–3.10、要求 3.11–3.13,并从 pip 迁移到 uv 安装。
Continue 提出 LLM 正在成为新的"胶水代码",用于粘合 webhook、CLI、REST API、数据库等格式各异的接口。其与 Snyk 合作将 AI 安全嵌入开发流程:Snyk 发出漏洞告警后,LLM 提取严重程度和受影响文件路径,生成补丁,再通过 CLI 跑测试并用 gh pr create 创建 PR。