LangGraph 1.2.13 发布
LangGraph 发布 1.2.13,集中修复 DeltaChannel 相关缺陷:不再为从未写入的 DeltaChannel 遍历历史,避免将废弃分支重放到 DeltaChannel fork,并在各 update_state 路径上保留 DeltaChannel 计数器。
LangGraph 发布 1.2.13,集中修复 DeltaChannel 相关缺陷:不再为从未写入的 DeltaChannel 遍历历史,避免将废弃分支重放到 DeltaChannel fork,并在各 update_state 路径上保留 DeltaChannel 计数器。
DeepSpeed 合并 PR #8497,为连续批处理 rollout 新增可选的 decode front 对齐路径:开启 align_decode_fronts 后按 attention mask 推导有效 prompt 长度、从长到短排序并右对齐 prefill,同时裁剪无效 cache 列,默认仍保持等宽填充布局。
vLLM 发布 v0.31.0rc5,在 requirements 中为 Transformers 版本添加了上限约束。该改动由 Isotr0py 提交、Harry Mellor 共同署名,并从主分支 cherry-pick 而来。
SGLang 发布 v0.5.21,合并 227 位贡献者的 779 个 PR,新增 DeepSeek-V4.1 Flash、GigaChat 3.5、MiMo-V2.6、Qwen-Image 2.1、FLUX 3 Action 等模型支持。
OpenAI Agents SDK 发布 v0.23.1 补丁版本,修复发布测试并刷新必需的 readiness 检查,SDK 运行时源码相对 v0.23.0 仅改动版本号字符串。
Ai2 开源 AstaBrief 8B,一个把研究问题和检索到的文献片段转成带引用报告的小模型,基于 Qwen3-8B 训练,现已作为 Asta 的 Fast 模式上线,并同步开放模型权重和训练数据。
推荐理由:原文给出了从 Qwen3-8B 出发的 SFT 加 DPO 训练配方与数据过滤经验,可迁移到其他垂直领域小模型。
vLLM 发布 v0.31.0rc4,修复了 HiSparse 在 FULL graphs 下 MTP 接受率崩溃的问题。该版本为候选发布版,主要针对上述 bug 进行修补。
Unsloth Desktop 新增 Cmd/Ctrl+P 命令面板,支持分享 GGUF 运行设置,并让 Laya 决策模型短请求提速最高 4.1 倍。
OpenAI Agents SDK 发布 v0.23.0,新增 MCP 列表页限制配置、沙箱 Docker 删除保护和内存整合轮次配置,以及可选的加密历史扫描预算。该版本还修复了智能体工具流式回调积压、嵌套工具状态隔离、工具失败详情脱敏等问题,并升级多项依赖。
Unsloth 发布 v0.1.901-beta,其 Studio 针对链接文件夹中的相同文件复用嵌入向量以提升性能。该版本提交已在 GitHub 上通过验证签名。
vLLM 发布 v0.31.0rc3,为 Model Runner V2 加入随机化 dummy inputs 支持(#58411)。该改动由 Robert Shaw 提交,并经 Claude Opus 5.5 等共同署名,属于候选版本更新。
Google DeepMind 发布 SynthID Bio,将水印技术引入合成生物学,把不可感知的签名直接嵌入生物代码,使水印不仅能在数字模型上验证,也能在合成出的实体蛋白质上验证,同时保持其生物功能。
推荐理由:SynthID 水印从图像扩展到合成生物,读者可了解其在 DNA 合成筛查与数据库标注上的验证思路。
Axolotl v0.20.0 发布,自 v0.19.0 以来累计 67 个 commit,新增 GGUF 导出、Ringmaster 上下文并行、原生 NVFP4 LoRA 和无 DeepEP 的专家并行。
vLLM 发布 vllm-proto 0.4.0,对应标签 proto-v0.4.0(提交 f28a508),该标签已通过提交者签名验证。此次发布附带 2 个资源文件。
vLLM 发布 v0.31.0rc2,修复 Mamba 在稀疏场景下 prompt-end prefill checkpoint 的保留问题。该版本为候选发布版,主要针对 Mamba 相关 bug 进行修正。
TRL 发布 v1.14.1,修复了 vLLM 0.20 至 0.25 上首次权重同步时的 server 模式崩溃问题。该版本还修复了 vLLM server 模式下工具调用后每个样本只生成一个 completion 的问题,并让 CLI 脚本保留显式的 model_init_kwargs、正确响应 resume_from_checkpoint。
Unsloth 新增决策模型支持,可在本地运行 Laya(开源 Jev)回答是/否、多选和评分问题并输出概率,通过 Settings > API 启用 Decision API,支持 TypeSafe SDK 的 Jev 兼容 /v1/systemone 端点。
TensorRT-LLM 发布 v1.3.0rc29,新增对 Qwen3.5 全局 FP8 权重、Kimi K3 NVFP4 SiTU 的 CuTeDSL MoE 后端以及 DeepSeek V4 NVFP4 MLA 残差开关的支持。
PEFT 发布 v0.21.1,使 Tensor Parallel(TP)能够与 PEFT 正常配合工作,需搭配 Transformers ≥ 5.17.0 使用。该版本为小型更新,包含 #3614、#3790 两项改动。
CrewAI 发布 1.15.23,新增对 Gemini 3.8 Flash 的原生支持,并让 crewai eval 通过 AMP 评估最近一次追踪运行、记录而非打印结果。该版本还优化了平台集成设置体验、优先展示热门集成,并修复了追踪面板可见性、TUI 评估按钮、Bedrock 同步调用回退及 SQLite 连接关闭等问题。
LMDeploy 发布 v0.18.0,新增输出与输入 logprobs 支持,并扩展 SM90 量化 GEMM、统一 TurboMind 线性执行。该版本为昇腾支持 glm52、为 qwen3.5 支持 dflash,同时加入 PyTorch 版 TurboMind W4A16 AWQ 线性后端原型与分段 CUDA graph 预填充。
Unsloth 发布面向 Linux x86_64、CUDA 13 的预编译 wheel,涵盖 flash-attn 2.8.4、causal-conv1d 1.7.0 和 mamba-ssm 2.3.2.post1,基于 PyTorch 2.13 与 2.14、Python 3.13 构建。
TRL v1.14.0 移除了 v1.13 引入的 trl.losses 模块,DPO、KTO、GRPO 改为通过 _ChunkedLogProbFunction 流式计算所选 token 的 log-probs,各自复用原有损失代码,不再重复实现损失数学。
LangGraph CLI 发布 0.4.32.dev0 开发版本,该版本由 GitHub Actions 于 9 月 23 日构建并签名发布。更新内容为 cli==0.4.32 以来的变更,附带 2 个资源文件。
LangGraph CLI 发布 0.4.32,新增将自托管部署置于 listener 的能力,并为自托管部署加入 --image-uri 参数。该版本还更新 langgraph deploy 命令改用 agent_id 和 environment 参数,并澄清 agent flags、支持环境变量默认值。
微软研究院对移动操作机器人工作负载做了首次系统性测量,发现把物理 AI 推理从机器人端侧 GPU 卸载到边缘或云端 GPU 可提升任务成功率、支持更大模型并延长续航。
推荐理由:微软研究院系统测量了机器人端侧 GPU 推理的瓶颈,并给出可复用的 Kubernetes 卸载工具链,读者可据此判断物理 AI 的部署取舍。
Unsloth 现已支持本地运行 Qwen-Image-2.1,该版本支持图像编辑与图像生成,并提供 Fast FP8 与 GGUF 修复。此次更新新增自定义 Agent Skills,可复用 Claude Code 和 .agents 文件夹中的技能,长推理块速度提升至 60 FPS(此前 30 FPS)。
TensorRT-LLM 发布 v1.3.0rc28,新增 DFlash 2 支持并为 Llama、Llama4 默认启用 KV-cache manager V2,同时扩展 Qwen3.8-Flash-Next 的 disaggregation、MegaMoE 与 GVR index reuse 支持。
微软研究院在 Nature 发表逆合成模型 RetroChimera,并开源其实现与权重。该模型用学习式重排序整合 Transformer 模型 R-SMILES 2 与 GNN 模型 NeuralLoc 的互补预测,在十项挑战性靶标的多步合成路线评测中成功 9 项,优于 de novo 模型的 5 项、编辑模型的 4 项和 NeuralSym 的 2 项。
LangGraph 发布 1.2.12,为 interrupt() 新增 response_schema 参数。该版本还修复了未声明 v3 流投影的类型问题,并改为从字节码而非源码检测子图。此外包含多项依赖升级,如 soupsieve 升至 2.9、mistune 升至 3.3.4、tornado 升至 6.5.8。
LangGraph SDK 发布 0.4.5 版本,同步发布 langgraph 1.2.12。新版本为 interrupt() 增加了 response_schema 支持,并升级了 anyio、websockets 等依赖。
SGLang 发布 v0.5.20,包含 237 位贡献者的 713 个 PR,新增 GLM-5.3-Flash、Qwen3.8-Flash-Next、Hy4-Preview、K2 Horizon、Nanbeige4.2 等模型支持。
Google Research 发布 MilleMiglia,一个用 C++ 编写的实例生成器,用于为中段物流配送问题生成真实且保护隐私的基准数据,源码与文档已在 GitHub 公开。
TensorRT-LLM 发布 v1.3.0rc27,新增 MiniMax-H3 VisualGen 文生视频与首尾帧生视频支持(BF16 和 FP8 blockwise),并支持 Nemotron 3.5 Super VL 多模态服务。
OpenAI Agents SDK 发布 v0.22.3,修复核心模块的条件审批与工具参数对齐、服务端恢复时工具未找到的输出投递,以及 Windows 主机上命令路径保持 POSIX 等问题。该版本还修复了会话并发异步 SQLite 启动、tracing 缓存缺失 OPENAI_API_KEY、扩展模块子进程回收等缺陷,并更新了 fastapi、starlette 等依赖。
CrewAI 发布 1.15.22,新增连接标识符别名支持,并将 OpenRouter 纳入支持的嵌入向量提供商。该版本在 crew 搭建阶段校验平台集成,向 JSON crew 向导添加平台工具,并公开 CrewAI Platform 应用目录。此外还修复了 Azure 流式工具调用按 wire index 归类、Gemini 文件数据内容保留等问题。
DeepSpeed 发布 v0.19.7 补丁版本,为 ZeRO checkpoint 导出新增可配置 dtype,并修复 seq-first Ulysses all2all 输出布局、flops profiler 统计重复计数等问题。
PEFT 发布 v0.21.0,新增 Riemannian 预条件 LoRA 优化器、LoRA 变体 KaSA、Super-Tuning 和 ShadowPEFT 四种方法。
Axolotl v0.19.0 发布,新增声明式模型支持系统,并支持 Qwen3.8-Flash-Next、Ling 3.0、Muse Glimmer 30B 等七个模型家族及三元(BitNet b1.58)QAT。
TRL v1.13.0 新增 1M token 长上下文训练支持,在单台 8×H100 节点上以 Qwen3-8B 实测 1,048,576 token、380 秒/步、每 GPU 56.2 GB(bf16)。