Zed 发布 Delta 公测版,用线程协作替代 Pull Request
Zed 团队发布 Delta 公测版,这是一个与智能体协作编码并评审其产出的多人环境,支持 macOS、Linux、Windows 及网页端,移动浏览器也可跟进线程。
推荐理由:Zed 团队公开了用 Delta 线程替代 PR 的协作方式与自用数据,可据此判断智能体时代代码评审的另一种组织形态。
Zed 团队发布 Delta 公测版,这是一个与智能体协作编码并评审其产出的多人环境,支持 macOS、Linux、Windows 及网页端,移动浏览器也可跟进线程。
推荐理由:Zed 团队公开了用 Delta 线程替代 PR 的协作方式与自用数据,可据此判断智能体时代代码评审的另一种组织形态。
Sourcegraph 上线 Agentic Batch Changes,采用按结果计费:只为最终合并进代码库的 changeset 付费,未合并不收费。该智能体在 harness、系统提示词、权限和工具上均为迁移场景专门设计,可生成千级 case 的 switch 语句而非部署上千个智能体以降低成本。
Sourcegraph 发布 Agentic Batch Changes,基于 Batch Changes 与 Deep Search 构建,用户用自然语言描述变更后,智能体在索引代码库中划定范围、制定计划、先在单个仓库试改再逐步铺开,仓库差异时自动适配,CI 失败时继续处理,直到 PR 可供人工审查合并。
推荐理由:Sourcegraph 把批量代码变更交给智能体编排,并给出按合并结果计费的方式,可观察大规模迁移的落地路径。
Axolotl v0.19.0 发布,新增声明式模型支持系统,并支持 Qwen3.8-Flash-Next、Ling 3.0、Muse Glimmer 30B 等七个模型家族及三元(BitNet b1.58)QAT。
Mistral 与 Cloudera 建立合作,将 Mistral 模型集成进 Cloudera 混合数据平台,企业可在私有云、公有云、本地及完全气隙环境中部署推理并保持完全控制。企业还能在受控环境中用专有数据训练定制模型,数据与由此产生的智能均归企业所有。Cloudera 平台承载 30 exabytes 客户自管数据,双方称此举面向对主权 AI 日益增长的需求。
TRL v1.13.0 新增 1M token 长上下文训练支持,在单台 8×H100 节点上以 Qwen3-8B 实测 1,048,576 token、380 秒/步、每 GPU 56.2 GB(bf16)。
Cursor 发布 Projects 功能,用于承接功能开发、迁移或完整应用等更大规模的工作,可跨数月保持上下文、把任务分派给数千个子智能体,并在无需提示的情况下执行周期性工作。
推荐理由:原文说明了协调者智能体如何拆分任务、共享上下文并常驻云端,可据此判断长周期开发工作流的组织方式。
CrewAI 发布 1.15.21,新增遥测以追踪 checkpoint 运行时和 CLI 使用情况。该版本修复了 HTTP 200 响应内上报的 gateway 错误、DashScope 模型改走原生 provider,并将 gpt-4o-mini 上下文窗口从 200000 更正为 128000。
Mistral 帮助一家欧洲能源运营商将 4 万行 Fortran 77 的油藏模拟器迁移到 C++,该代码库没有测试套件也没有集中文档。团队先搭建数值对齐测试框架,用 Skill.md 引导智能体导出 Fortran 状态快照并在 C++ 侧校验,再用自定义解析器生成调用树、由 Vibe CLI 调度上百个智能体逐节点补文档。
TensorRT-LLM 发布 v1.3.0rc26,新增 DeepSeek-V4 Hopper、Qwen3.8-Flash-Next 支持,并在 B200 上启用 Kimi K3。
SGLang 发布 v0.5.19,合并 214 位贡献者的 786 个 PR,新增 Qwen3.8(2.4T-A95B)、Qwen3.8-27B、Ling-3.0-flash、Spark2.5、Granite 4.2 等模型支持。
CrewAI 发布 1.15.19,新增 Clipper 集成客户端,并在 CEL 表达式环境中加入 now()。该版本记录每次 crew 运行结束方式,机器规格改为按粗略档位而非核心数上报,同时为 CrewAI 平台工具加入可注入客户端。
Cursor 上线 self-hosted machines,让工具执行完全留在用户自己的网络内,代码库、构建产物和密钥都保存在自有基础设施的机器上,由智能体在本地处理工具调用。
推荐理由:Cursor 把智能体的工具执行放进企业自有网络,读者可据此判断代码与密钥不出内网的落地方式。
LMDeploy 发布 v0.17.0,新增对 Kimi K2.6 和 DeepEPv2 的支持,并集成 mooncake store 作为 KV connector。该版本进一步优化 GLM-5.2 服务性能,在 CUDA 上为 paged attention 和 V4 prefill 引入 PDL,同时降低投机解码前后处理开销,并支持非 2 的幂次 page size。
Zed 团队认为,Ted Nelson 的 Xanadu 超文本构想(永不复制只引用、永不覆盖只版本化)缺的最后一个依赖是 AI 智能体这类新用户。DeltaDB 用 Lamport 时间戳、Merkle 树、CRDT 等已有技术为每个状态命名,Delta 的 worktree 可被多地的人与智能体同时编辑,每个版本默认保留。
TensorRT-LLM v1.3.0rc25 将 KV cache manager V2 设为 DeepSeek V3/R1/V3 Lite、DeepSeek V3.2/V4。
Sourcegraph 的 Deep Search 在沙箱中围绕 Sourcegraph 搜索 API 运行脚本,让迁移审计只返回 CSV 清单,而不是数千个文件的 token。
DeepSpeed 发布 v0.19.6 补丁版本,新增 Apple Silicon(MPS)上的 ZeRO Stage 1-3 支持,并加入 Metal FusedAdam 内核与 CPU Adam 构建。
Cursor Cloud Agents 不再要求预先连接 GitHub 等第三方 SCM 提供商,用户可在 repo picker 中选择 Start from scratch 直接提示智能体,Cursor 会在后台创建 Origin repo。
TRL v1.12.0 是 v1.11.0 的意外重复版本,两者在 PyPI 上的代码逐字节相同,没有任何新功能、修复或行为变化。
TRL v1.11.0 发布,其 vllm-serve 不再自建 FastAPI 服务,改为转发到 vLLM 原生 server,脚本从 1218 行降至约 130 行,权重同步改用 vLLM 的 NCCL weight-transfer 引擎。
Google Cloud 将原生 TPU 支持集成进 vLLM,并以 Qwen3-Embedding-8B 和 Qwen3-VL-Embedding-8B 为目标模型做了多项工程优化,支持 4K+ token 文本和 15K+ token 多模态输入。
推荐理由:原文给出 vLLM-TPU 上部署 Qwen3 嵌入模型的具体优化与开源配方,可了解长上下文多模态嵌入的工程路径。
SGLang 发布 v0.5.18,合并 212 位贡献者的 710 个 PR,新增 Muse Glimmer、Intern-S2-Mobius、SANA-Video、LTX-2.5、Cosmos3、LongCat-Image 等模型支持。
Mistral 发布 Agentic Search,一个让模型在多步检索循环中查找、检查和验证信息的检索层,通过 Mistral Search Toolkit 提供,并内置于 Studio 和 Vibe 的 Libraries。
推荐理由:原文给出多步检索循环在 FinanceBench 与 OfficeQA Pro 上的准确率、token 与延迟变化,可据此判断传统 one-shot RAG 的边界。
JetBrains Air 新版本加入多项目视图,可在同一窗口打开多个项目并并行运行智能体,侧边栏按项目分组任务。Markdown 文件现支持编辑时直接渲染为格式化文本,无需分屏预览。Windows 端中文、日文、韩文等 IME 输入问题已修复,该版本还新增首次启动的 Customize 界面和 Agent Review 的智能体与模型选择。
LMDeploy 发布 v0.16.0,新增 GLM-5.2、Intern-S2-Mobius meta-MoE 与 Hy3 支持,并为 InternVL、Qwen VL 模型加入 TurboMind ViT 支持。
Cursor 发布云智能体与 Cursor harness 更新,让常驻智能体可自动响应事件、保持目标并完成长会话任务。新增 Subscriptions 让云智能体监控 PR、Slack 线程或定时任务,并自动订阅自己创建的 PR 直至完成;子智能体可运行在各自独立的虚拟机环境中。此外还加入 Custom Modes、/goal 长周期目标指令,以及不打断智能体的 Steering 改进。
推荐理由:官方更新列出云智能体的订阅、目标保持与子智能体独立环境等能力,可据此判断常驻智能体工作流的变化。
Cursor 上线 Origin 代码托管,今日起面向所有付费方案开放早期 beta,企业组织管理员可选择退出。首批功能包括仓库、Pull Request、代码浏览和 GitHub 同步,Origin 托管的仓库以 Origin 为唯一来源,同步的 GitHub 仓库仍以 GitHub 为准,PR 评论双向同步。
推荐理由:Cursor 把代码托管、PR 与智能体放进同一入口,读者可据此判断它与 GitHub 的分工边界。
OpenAI Agents SDK 发布 v0.21.0,新增 agents.testing、agents.realtime.testing 和 agents.voice.testing 工具,可在不发起 provider 请求的情况下对 Agent、Sandbox、Realtime 和 Voice 工作流做确定性测试。
Cursor 为 Cloud Agents 推出 Builds 功能,在后台预先准备已克隆仓库、装好依赖并跑完安装脚本的环境副本,智能体直接启动而无需每次从零配置,该功能不额外收费。
推荐理由:原文给出 Cloud Agents 环境预构建的机制与启动提速数据,可据此判断智能体启动流程的改动方式。
TensorRT-LLM 发布 v1.3.0rc24,新增 Kimi K3(含 KDA kernel、优化 MoE、投机解码与分离式服务)、MiniCPM-V 4.6 图像视频支持,以及 PyTorch 后端的 Whisper 支持。
Zed 团队发布 Delta,一个面向智能体编码与代码审阅的多人协作环境,首批用户已进入私测。Delta 基于自研 DeltaDB,将对话与 worktree 实时同步,兼容现有 git 仓库,评论可锚定到任意代码行并随代码演进;DeltaDB 还支持云端运行,关闭笔记本后智能体继续工作,并可通过链接在浏览器打开。
推荐理由:Zed 团队把 DeltaDB 的实时同步能力做成独立应用,读者可了解多人协作写代码与审阅智能体产出的新形态。
SGLang v0.5.17 发布,含 194 位贡献者的 582 个 PR,首日支持 2.8T 参数多模态模型 Kimi K3 和 MiniMax-H3 视频生成模型。
DeepSpeed 发布 v0.19.5 补丁版本,修复 ZeRO++ 小参数次级分片拷贝、AutoEP ZeRO-1/2 通用转换及 torch 2.12+ 编译错误等问题。该版本还默认启用 ZeRO-3 异步梯度卸载与固定内存卸载缓冲区,将原生主机内存固定拆分为独立的 pin_memory 算子,并恢复自定义 DCO 工作流。
DeepSpeed 发布 v0.19.4 补丁版本,为 ZeRO stage 0/1/2/3 加入 managed_gradient_accumulation 支持,并新增面向 Ampere/Ada 的 MoE 专家 Triton grouped-GEMM。
Zed 在 1.14 版本起为智能体面板的终端和 fetch 工具默认启用沙箱,由操作系统强制执行,默认禁止在项目目录外写入、写入 .git 以及发起网络请求,智能体需要时可申请临时提权并说明理由。
推荐理由:Zed 官方说明智能体沙箱的默认规则、权限升级流程与实现方式,并给出沙箱边界之外的攻击面清单。
JetBrains 在 2026 上半年 AI 开发支出增长约 10 倍后,把内部调试用的 CLI 包装器做成 JetBrains Central CLI,并于 7 月 8 日开放早期访问,任何拥有 JetBrains AI credits 的个人或组织均可使用。
推荐理由:JetBrains 公开了内部 AI 成本治理的完整路径,从失控到自研 CLI 再到开放早期访问,可对照自身团队的多工具开销问题。
LMDeploy 发布 v0.15.0,新增 DeepSeek V4 支持,并支持长上下文与 MTP 前缀缓存命中。该版本为投机解码加入引导式解码支持,新增 AgRs all2all 后端与 memdecode 支持,同时优化 TTFT 并改进 Ascend-A3 多节点支持。
Berkeley AI Research 与 IBM Research 将 K-Search 进化式内核搜索框架扩展到 MLX,通过结构化 CUDA-to-MLX 翻译层把已有 CUDA 内核经验迁移到 Apple Silicon。
推荐理由:展示了把 CUDA 内核优化经验结构化迁移到 Apple Silicon 的方法,并给出注意力与 Mamba 两类内核的实测对比。
Sourcegraph 提出以"限定范围检索"为智能体留下可审计的溯源记录,即明确列出智能体在改动代码前读过哪些文件及原因。其 Deep Search 会在每次回答中返回显式来源清单,MCP server 则把读文件、关键词搜索、跳转定义等操作拆成可单独观测的事件,并受仓库权限与 scoped token 约束,处理在用户自有实例内完成,仅模型调用对外。