Unsloth 发布 Flash-Attention2、Causal-Conv1D、Mamba_SSM 预编译 wheel
Unsloth 发布面向 Linux x86_64、CUDA 13 的预编译 wheel,涵盖 flash-attn 2.8.4、causal-conv1d 1.7.0 和 mamba-ssm 2.3.2.post1,基于 PyTorch 2.13 与 2.14、Python 3.13 构建。
Unsloth 发布面向 Linux x86_64、CUDA 13 的预编译 wheel,涵盖 flash-attn 2.8.4、causal-conv1d 1.7.0 和 mamba-ssm 2.3.2.post1,基于 PyTorch 2.13 与 2.14、Python 3.13 构建。
Claude Agent SDK 发布 v0.2.160,修复后台子智能体在轮次结果到达前完成时 stdin 被过早关闭、导致后续轮次报 "Stream closed" 的问题。
TRL v1.14.0 移除了 v1.13 引入的 trl.losses 模块,DPO、KTO、GRPO 改为通过 _ChunkedLogProbFunction 流式计算所选 token 的 log-probs,各自复用原有损失代码,不再重复实现损失数学。
Google 团队在 Google Cloud TPU 上用 MaxText 从零复现了 Ai2 的 Olmo 3 7B,覆盖 stage-1 预训练与 stage-2 mid-training anneal,并在留出指标上验证匹配。
Google Cloud API Gateway 进入 Public Preview,可作为远程 MCP 服务器,在已有 OpenAPI 3.0.x 或 3.1.x 规范上通过 x-google-api-management.mcp 注解,把现有 REST 操作暴露为智能体可调用的 MCP 工具,无需另建服务器。
推荐理由:原文给出把现有 REST API 直接暴露为 MCP 工具的具体配置步骤与限制,可据此评估改造成本。
LangGraph CLI 发布 0.4.32.dev0 开发版本,该版本由 GitHub Actions 于 9 月 23 日构建并签名发布。更新内容为 cli==0.4.32 以来的变更,附带 2 个资源文件。
GitHub Copilot 应用重建了 pull request 视图,以应对超大 diff 与评论带来的渲染压力,实测对象是一个包含 2,200 个文件、超 100 万行改动和 400 多条行内评论的开源 pull request。方案将文档高度拆成确定性的代码几何与动态块几何两部分:代码行高可提前精确计算,评论、草稿和回复框则按块惰性测量,并锚定到文件、行号和侧别而非像素坐标。
LangGraph CLI 发布 0.4.32,新增将自托管部署置于 listener 的能力,并为自托管部署加入 --image-uri 参数。该版本还更新 langgraph deploy 命令改用 agent_id 和 environment 参数,并澄清 agent flags、支持环境变量默认值。
Google Beam 正式扩展至美国、加拿大、英国、法国、德国和日本六国,由 18 家渠道合作伙伴支持部署,旗舰硬件为 HP Dimension with Google Beam。
微软研究院对移动操作机器人工作负载做了首次系统性测量,发现把物理 AI 推理从机器人端侧 GPU 卸载到边缘或云端 GPU 可提升任务成功率、支持更大模型并延长续航。
推荐理由:微软研究院系统测量了机器人端侧 GPU 推理的瓶颈,并给出可复用的 Kubernetes 卸载工具链,读者可据此判断物理 AI 的部署取舍。
Google Private AI Compute 团队公布为 Private AI Compute 平台引入私有服务端记忆的技术方案,让云端 AI 在跨设备场景下持久保留上下文,同时维持端侧级隐私标准。
推荐理由:Google 公开了 Private AI Compute 的持久化服务端记忆方案,读者可了解云端 AI 如何在保留跨设备上下文的同时维持端侧级隐私。
Unsloth 现已支持本地运行 Qwen-Image-2.1,该版本支持图像编辑与图像生成,并提供 Fast FP8 与 GGUF 修复。此次更新新增自定义 Agent Skills,可复用 Claude Code 和 .agents 文件夹中的技能,长推理块速度提升至 60 FPS(此前 30 FPS)。
TensorRT-LLM 发布 v1.3.0rc28,新增 DFlash 2 支持并为 Llama、Llama4 默认启用 KV-cache manager V2,同时扩展 Qwen3.8-Flash-Next 的 disaggregation、MegaMoE 与 GVR index reuse 支持。
Claude Agent SDK v0.2.158 新增 ClaudeAgentOptions.verbatim_prompts 选项(默认 False),开启后用户消息原样传给 CLI,不做 @path 文件展开和斜杠命令分发,可防止提示词中内联的不可信文本触发意外文件读取或命令执行。该选项需 CLI 2.1.248+,旧版本会记录警告,并已内置更新至 Claude CLI 2.1.280。
Cursor 发布 Rollouts 和 Security Review 两个机器人,面向代码交付的最后环节,今日起在 Teams 和 Enterprise 套餐提供。
推荐理由:Cursor 把部署监控与安全审查做成两个 PR 机器人,读者可据此判断代码上线环节的自动化边界。
Sourcegraph 认为,AI 编程已把 prompt-to-PR 流程打磨到极致,但大型企业存量代码库的维护仍完全未解决。作者提出"自主代码库"构想:由触发器(定时任务、新 CVE、生产日志异常等)驱动可调用的智能体函数(全库 Deep Search、推送 PR、批量变更),组成确定性有向图工作流。未来企业将转向范围更窄、授权更小的智能体组合,而非继续泛化通用 harness。
SGLang 发布 v0.5.20,包含 237 位贡献者的 713 个 PR,新增 GLM-5.3-Flash、Qwen3.8-Flash-Next、Hy4-Preview、K2 Horizon、Nanbeige4.2 等模型支持。
TensorRT-LLM 发布 v1.3.0rc27,新增 MiniMax-H3 VisualGen 文生视频与首尾帧生视频支持(BF16 和 FP8 blockwise),并支持 Nemotron 3.5 Super VL 多模态服务。
JetBrains 分享了其语义代码搜索平台 Air Context 的 RAG 流水线构建经验,首篇聚焦解析、分块与向量化。团队指出固定行数分块会把 import 语句和函数内容等无关代码混在一起导致检索错误,因此采用基于解析器的结构感知分块,利用 Java 等语言的类结构约定划分语义单元。该平台旨在让 LLM 智能体按语义而非关键词检索代码,获得可引用的仓库证据。
CrewAI 发布 1.15.22,新增连接标识符别名支持,并将 OpenRouter 纳入支持的嵌入向量提供商。该版本在 crew 搭建阶段校验平台集成,向 JSON crew 向导添加平台工具,并公开 CrewAI Platform 应用目录。此外还修复了 Azure 流式工具调用按 wire index 归类、Gemini 文件数据内容保留等问题。
DeepSpeed 发布 v0.19.7 补丁版本,为 ZeRO checkpoint 导出新增可配置 dtype,并修复 seq-first Ulysses all2all 输出布局、flops profiler 统计重复计数等问题。
Zed 团队发布 Delta 公测版,这是一个与智能体协作编码并评审其产出的多人环境,支持 macOS、Linux、Windows 及网页端,移动浏览器也可跟进线程。
推荐理由:Zed 团队公开了用 Delta 线程替代 PR 的协作方式与自用数据,可据此判断智能体时代代码评审的另一种组织形态。
Sourcegraph 上线 Agentic Batch Changes,采用按结果计费:只为最终合并进代码库的 changeset 付费,未合并不收费。该智能体在 harness、系统提示词、权限和工具上均为迁移场景专门设计,可生成千级 case 的 switch 语句而非部署上千个智能体以降低成本。
Sourcegraph 发布 Agentic Batch Changes,基于 Batch Changes 与 Deep Search 构建,用户用自然语言描述变更后,智能体在索引代码库中划定范围、制定计划、先在单个仓库试改再逐步铺开,仓库差异时自动适配,CI 失败时继续处理,直到 PR 可供人工审查合并。
推荐理由:Sourcegraph 把批量代码变更交给智能体编排,并给出按合并结果计费的方式,可观察大规模迁移的落地路径。
Axolotl v0.19.0 发布,新增声明式模型支持系统,并支持 Qwen3.8-Flash-Next、Ling 3.0、Muse Glimmer 30B 等七个模型家族及三元(BitNet b1.58)QAT。
Mistral 与 Cloudera 建立合作,将 Mistral 模型集成进 Cloudera 混合数据平台,企业可在私有云、公有云、本地及完全气隙环境中部署推理并保持完全控制。企业还能在受控环境中用专有数据训练定制模型,数据与由此产生的智能均归企业所有。Cloudera 平台承载 30 exabytes 客户自管数据,双方称此举面向对主权 AI 日益增长的需求。
TRL v1.13.0 新增 1M token 长上下文训练支持,在单台 8×H100 节点上以 Qwen3-8B 实测 1,048,576 token、380 秒/步、每 GPU 56.2 GB(bf16)。
Cursor 发布 Projects 功能,用于承接功能开发、迁移或完整应用等更大规模的工作,可跨数月保持上下文、把任务分派给数千个子智能体,并在无需提示的情况下执行周期性工作。
推荐理由:原文说明了协调者智能体如何拆分任务、共享上下文并常驻云端,可据此判断长周期开发工作流的组织方式。
CrewAI 发布 1.15.21,新增遥测以追踪 checkpoint 运行时和 CLI 使用情况。该版本修复了 HTTP 200 响应内上报的 gateway 错误、DashScope 模型改走原生 provider,并将 gpt-4o-mini 上下文窗口从 200000 更正为 128000。
Mistral 帮助一家欧洲能源运营商将 4 万行 Fortran 77 的油藏模拟器迁移到 C++,该代码库没有测试套件也没有集中文档。团队先搭建数值对齐测试框架,用 Skill.md 引导智能体导出 Fortran 状态快照并在 C++ 侧校验,再用自定义解析器生成调用树、由 Vibe CLI 调度上百个智能体逐节点补文档。
TensorRT-LLM 发布 v1.3.0rc26,新增 DeepSeek-V4 Hopper、Qwen3.8-Flash-Next 支持,并在 B200 上启用 Kimi K3。
SGLang 发布 v0.5.19,合并 214 位贡献者的 786 个 PR,新增 Qwen3.8(2.4T-A95B)、Qwen3.8-27B、Ling-3.0-flash、Spark2.5、Granite 4.2 等模型支持。
CrewAI 发布 1.15.19,新增 Clipper 集成客户端,并在 CEL 表达式环境中加入 now()。该版本记录每次 crew 运行结束方式,机器规格改为按粗略档位而非核心数上报,同时为 CrewAI 平台工具加入可注入客户端。
Cursor 上线 self-hosted machines,让工具执行完全留在用户自己的网络内,代码库、构建产物和密钥都保存在自有基础设施的机器上,由智能体在本地处理工具调用。
推荐理由:Cursor 把智能体的工具执行放进企业自有网络,读者可据此判断代码与密钥不出内网的落地方式。
LMDeploy 发布 v0.17.0,新增对 Kimi K2.6 和 DeepEPv2 的支持,并集成 mooncake store 作为 KV connector。该版本进一步优化 GLM-5.2 服务性能,在 CUDA 上为 paged attention 和 V4 prefill 引入 PDL,同时降低投机解码前后处理开销,并支持非 2 的幂次 page size。
Zed 团队认为,Ted Nelson 的 Xanadu 超文本构想(永不复制只引用、永不覆盖只版本化)缺的最后一个依赖是 AI 智能体这类新用户。DeltaDB 用 Lamport 时间戳、Merkle 树、CRDT 等已有技术为每个状态命名,Delta 的 worktree 可被多地的人与智能体同时编辑,每个版本默认保留。
TensorRT-LLM v1.3.0rc25 将 KV cache manager V2 设为 DeepSeek V3/R1/V3 Lite、DeepSeek V3.2/V4。
Sourcegraph 的 Deep Search 在沙箱中围绕 Sourcegraph 搜索 API 运行脚本,让迁移审计只返回 CSV 清单,而不是数千个文件的 token。
DeepSpeed 发布 v0.19.6 补丁版本,新增 Apple Silicon(MPS)上的 ZeRO Stage 1-3 支持,并加入 Metal FusedAdam 内核与 CPU Adam 构建。
Cursor Cloud Agents 不再要求预先连接 GitHub 等第三方 SCM 提供商,用户可在 repo picker 中选择 Start from scratch 直接提示智能体,Cursor 会在后台创建 Origin repo。