TRL v1.12.0 误发布:与 v1.11.0 代码完全相同
TRL v1.12.0 是 v1.11.0 的意外重复版本,两者在 PyPI 上的代码逐字节相同,没有任何新功能、修复或行为变化。
TRL v1.12.0 是 v1.11.0 的意外重复版本,两者在 PyPI 上的代码逐字节相同,没有任何新功能、修复或行为变化。
TRL v1.11.0 发布,其 vllm-serve 不再自建 FastAPI 服务,改为转发到 vLLM 原生 server,脚本从 1218 行降至约 130 行,权重同步改用 vLLM 的 NCCL weight-transfer 引擎。
Google Cloud 将原生 TPU 支持集成进 vLLM,并以 Qwen3-Embedding-8B 和 Qwen3-VL-Embedding-8B 为目标模型做了多项工程优化,支持 4K+ token 文本和 15K+ token 多模态输入。
推荐理由:原文给出 vLLM-TPU 上部署 Qwen3 嵌入模型的具体优化与开源配方,可了解长上下文多模态嵌入的工程路径。
SGLang 发布 v0.5.18,合并 212 位贡献者的 710 个 PR,新增 Muse Glimmer、Intern-S2-Mobius、SANA-Video、LTX-2.5、Cosmos3、LongCat-Image 等模型支持。
METR 研究显示 AI 对科学的加速并不均衡:2026 年网络安全漏洞报告速度较 2025 年大幅加快,数学领域贡献有限,AI 研究本身尚无显著加速。多校团队提出 SPADE 框架,通过自博弈让 LLM 交替生成可执行训练环境并求解,在 Qwen3-30B-A3B 上游戏环境套件均分达 58.3,较基线提升 8.1。
Mistral 发布 Agentic Search,一个让模型在多步检索循环中查找、检查和验证信息的检索层,通过 Mistral Search Toolkit 提供,并内置于 Studio 和 Vibe 的 Libraries。
推荐理由:原文给出多步检索循环在 FinanceBench 与 OfficeQA Pro 上的准确率、token 与延迟变化,可据此判断传统 one-shot RAG 的边界。
JetBrains Air 新版本加入多项目视图,可在同一窗口打开多个项目并并行运行智能体,侧边栏按项目分组任务。Markdown 文件现支持编辑时直接渲染为格式化文本,无需分屏预览。Windows 端中文、日文、韩文等 IME 输入问题已修复,该版本还新增首次启动的 Customize 界面和 Agent Review 的智能体与模型选择。
LMDeploy 发布 v0.16.0,新增 GLM-5.2、Intern-S2-Mobius meta-MoE 与 Hy3 支持,并为 InternVL、Qwen VL 模型加入 TurboMind ViT 支持。
Cursor 发布云智能体与 Cursor harness 更新,让常驻智能体可自动响应事件、保持目标并完成长会话任务。新增 Subscriptions 让云智能体监控 PR、Slack 线程或定时任务,并自动订阅自己创建的 PR 直至完成;子智能体可运行在各自独立的虚拟机环境中。此外还加入 Custom Modes、/goal 长周期目标指令,以及不打断智能体的 Steering 改进。
推荐理由:官方更新列出云智能体的订阅、目标保持与子智能体独立环境等能力,可据此判断常驻智能体工作流的变化。
Cursor 上线 Origin 代码托管,今日起面向所有付费方案开放早期 beta,企业组织管理员可选择退出。首批功能包括仓库、Pull Request、代码浏览和 GitHub 同步,Origin 托管的仓库以 Origin 为唯一来源,同步的 GitHub 仓库仍以 GitHub 为准,PR 评论双向同步。
推荐理由:Cursor 把代码托管、PR 与智能体放进同一入口,读者可据此判断它与 GitHub 的分工边界。
OpenAI Agents SDK 发布 v0.21.0,新增 agents.testing、agents.realtime.testing 和 agents.voice.testing 工具,可在不发起 provider 请求的情况下对 Agent、Sandbox、Realtime 和 Voice 工作流做确定性测试。
Cursor 为 Cloud Agents 推出 Builds 功能,在后台预先准备已克隆仓库、装好依赖并跑完安装脚本的环境副本,智能体直接启动而无需每次从零配置,该功能不额外收费。
推荐理由:原文给出 Cloud Agents 环境预构建的机制与启动提速数据,可据此判断智能体启动流程的改动方式。
TensorRT-LLM 发布 v1.3.0rc24,新增 Kimi K3(含 KDA kernel、优化 MoE、投机解码与分离式服务)、MiniCPM-V 4.6 图像视频支持,以及 PyTorch 后端的 Whisper 支持。
Zed 团队发布 Delta,一个面向智能体编码与代码审阅的多人协作环境,首批用户已进入私测。Delta 基于自研 DeltaDB,将对话与 worktree 实时同步,兼容现有 git 仓库,评论可锚定到任意代码行并随代码演进;DeltaDB 还支持云端运行,关闭笔记本后智能体继续工作,并可通过链接在浏览器打开。
推荐理由:Zed 团队把 DeltaDB 的实时同步能力做成独立应用,读者可了解多人协作写代码与审阅智能体产出的新形态。
SGLang v0.5.17 发布,含 194 位贡献者的 582 个 PR,首日支持 2.8T 参数多模态模型 Kimi K3 和 MiniMax-H3 视频生成模型。
DeepSpeed 发布 v0.19.5 补丁版本,修复 ZeRO++ 小参数次级分片拷贝、AutoEP ZeRO-1/2 通用转换及 torch 2.12+ 编译错误等问题。该版本还默认启用 ZeRO-3 异步梯度卸载与固定内存卸载缓冲区,将原生主机内存固定拆分为独立的 pin_memory 算子,并恢复自定义 DCO 工作流。
DeepSpeed 发布 v0.19.4 补丁版本,为 ZeRO stage 0/1/2/3 加入 managed_gradient_accumulation 支持,并新增面向 Ampere/Ada 的 MoE 专家 Triton grouped-GEMM。
Zed 在 1.14 版本起为智能体面板的终端和 fetch 工具默认启用沙箱,由操作系统强制执行,默认禁止在项目目录外写入、写入 .git 以及发起网络请求,智能体需要时可申请临时提权并说明理由。
推荐理由:Zed 官方说明智能体沙箱的默认规则、权限升级流程与实现方式,并给出沙箱边界之外的攻击面清单。
JetBrains 在 2026 上半年 AI 开发支出增长约 10 倍后,把内部调试用的 CLI 包装器做成 JetBrains Central CLI,并于 7 月 8 日开放早期访问,任何拥有 JetBrains AI credits 的个人或组织均可使用。
推荐理由:JetBrains 公开了内部 AI 成本治理的完整路径,从失控到自研 CLI 再到开放早期访问,可对照自身团队的多工具开销问题。
LMDeploy 发布 v0.15.0,新增 DeepSeek V4 支持,并支持长上下文与 MTP 前缀缓存命中。该版本为投机解码加入引导式解码支持,新增 AgRs all2all 后端与 memdecode 支持,同时优化 TTFT 并改进 Ascend-A3 多节点支持。
Berkeley AI Research 与 IBM Research 将 K-Search 进化式内核搜索框架扩展到 MLX,通过结构化 CUDA-to-MLX 翻译层把已有 CUDA 内核经验迁移到 Apple Silicon。
推荐理由:展示了把 CUDA 内核优化经验结构化迁移到 Apple Silicon 的方法,并给出注意力与 Mamba 两类内核的实测对比。
Sourcegraph 提出以"限定范围检索"为智能体留下可审计的溯源记录,即明确列出智能体在改动代码前读过哪些文件及原因。其 Deep Search 会在每次回答中返回显式来源清单,MCP server 则把读文件、关键词搜索、跳转定义等操作拆成可单独观测的事件,并受仓库权限与 scoped token 约束,处理在用户自有实例内完成,仅模型调用对外。
SGLang 发布 v0.5.16,包含 169 位贡献者的 574 个 PR。新投机解码算法 DSpark 在 DeepSeek-V4-Pro 上达到 383.7 tok/s,新增 975B 参数、1M token 上下文的 Inkling 多模态 MoE 模型支持。该版本还移除 QServe 与 FBGEMM FP8 量化路径,NVFP4 GEMM 现需 FlashInfer。
DeepSpeed 发布 v0.19.3 补丁版本,修复 ZeRO-3 在混合参数 dtype 下的 allgather 与 autocast 问题,并将 gradient_clipping 默认值设为 1.0、bf16 check_grad_overflow 默认开启。
JetBrains Air 新版本通过 JetBrains 与 Zed 开发的 Agent Client Protocol(ACP)接入 GitHub Copilot、OpenCode、Pi、Cline 等兼容智能体,此前该工作流仅限 Air 自带的 Claude、Codex、Gemini CLI 和 Junie。
推荐理由:Air 通过 ACP 接入多家编码智能体并支持本地模型,读者可据此判断企业既有工具能否纳入同一工作流。
JetBrains 发布 JetBrains Context,一个为编码智能体构建语义索引并提供语义检索的仓库智能层,已随 JetBrains AI 订阅开放早期访问且不额外收费。
推荐理由:官方给出 JetBrains Context 的索引机制、接入方式与三项基准上的耗时成本降幅,可据此判断编码智能体的上下文方案。
Axolotl v0.18.0 发布,自 v0.17.0 以来累计超 90 次提交,主打低成本微调超大规模稀疏 MoE 模型。新增 NVFP4 MoE-LoRA,在 ScatterMoE 与 SonicMoE 后端支持 4-bit 专家 LoRA/QLoRA,4k 至 32k 上下文下显存占用近乎持平,并支持 GLM-5.2(DSA)2D 专家并行微调。
SGLang 发布 v0.5.15.post1 补丁版本,主要修复 GLM 5.2 相关问题。该版本修复了 GLM 5.2 IndexShare 在 PD 分离和 Context Parallel 设置下的问题,并解决了 flashinfer trtllm FP4 MoE kernel 在长输入下导致的 NaN 输出。
Veracode 测试超 100 个大语言模型发现 45% 的 AI 生成代码样本未通过安全测试,Apiiro 的 Fortune 50 研究显示 AI 辅助开发者的提交量增加 3 至 4 倍、团队安全问题数增加 10 倍。
SGLang v0.5.15 发布,针对 Blackwell 调优的 GLM-5.2 NVFP4 在 8x B300 上实现 500+ tok/s/user、4x GB300 上 450 tok/s/user(bs=1)。
伯克利 EPIC Data Lab 提出,随着推理成本从 2023 年初 GPT-4 级约 $30/百万 token 降至如今不到 $1、部分低于 $0.10,数据系统面临三大新挑战:为智能体设计(Data Systems For Agents)、运行智能体(Of Agents)、由智能体构建(By Agents)。
LMDeploy 发布 v0.14.0,新增 FP8 KV cache 量化、Qwen3 Omni 支持,并在 turbomind 后端支持 Qwen3.5(vit)推理。该版本还加入 OpenAI Responses 兼容端点和 /get_ppl 接口,并扩展 chat completions 支持 token-in/out 与返回 routed experts。
Zed 发布 Hidden Gems 系列第四篇,介绍居中布局、多项目键盘导航、集成终端中设置 EDITOR 为 zed --wait、命令别名(command_aliases)以及用大纲面板紧凑浏览搜索结果等技巧。其中 command_aliases 可为命令面板中的任意命令定义单词别名,例如将 gd 映射到 git::Diff、gcp 映射到 git::CreatePullRequest。
CrewAI 在 CrewAI AMP 中新增 Databricks 托管集成,提供四个独立配置的 MCP server:Genie 负责自然语言问数、Databricks SQL 负责查询执行、Unity Catalog Functions 负责调用已注册业务逻辑、Vector Search 负责检索 Mosaic AI 向量索引。
DeepSpeed 发布 v0.19.2 补丁版本,新增 engine.coalesce_grad_reduction() 支持 ZeRO 1/2/3 多次反向传播,并加入 AutoEP 与 Biren SUPA 加速器支持。
LMDeploy 发布 v0.14.0a2,新增 FP8 KV cache 量化、Qwen3 Omni 支持,并在 turbomind 后端支持 Qwen3.5(vit)推理。该版本还加入 OpenAI Responses 兼容端点,扩展 chat completions 与 v1/messages 的 token 输入输出并返回 routed experts。
Zed 正在开发 DeltaDB,一种以细粒度 delta 取代 commit 的新型版本控制系统,可把与 AI 智能体的对话和其编辑的 worktree 一起版本化,beta 版将在几周内推出。
CrewAI 提出"受治理编排"模式,让智能体跨系统协同工作,同时由平台从设计之初就承载治理能力。该模式结合 Snowflake 的权限模型与数据血缘,以及 CrewAI 的构建与运行时层,使智能体在不突破企业信任边界的前提下规模化运行。
Axolotl v0.17.0 发布,新增基于 DeepEP 的 MoE 专家并行(EP)训练、BitNet 1.58-bit 全量微调,以及通过 Tinker 兼容 API 的远程训练。
LMDeploy 发布 v0.14.0a1,新增 FP8 KV cache 量化,并加入 Qwen3.5 MoE lite AWQ 支持。该版本扩展 chat completions 接口,支持 token-in/out 与返回 routed experts,并按 OpenAI 规范新增 AllowedToolChoice、解析失败返回 400。