Unsloth Desktop 更新:命令面板、4-bit 检查点训练与 Laya 推理提速
Unsloth Desktop 新增 Cmd/Ctrl+P 命令面板,支持分享 GGUF 运行设置,并让 Laya 决策模型短请求提速最高 4.1 倍。
Unsloth Desktop 新增 Cmd/Ctrl+P 命令面板,支持分享 GGUF 运行设置,并让 Laya 决策模型短请求提速最高 4.1 倍。
ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例与更强教师的成功示范,自动生成并验证新的可执行训练任务,并随模型进步动态调整课程。该流程以 EnterpriseOps Gym 数据集为例演示,生成的任务需满足可行性、真实性与难度三项要求,验证器则需保证一致性、可靠性与完整性。
OpenAI 在 API 以及符合条件的 ChatGPT Work 和 Codex 用户中上线 GPT-6 Astra Ultrafast,该模式运行在 NVIDIA Blackwell GPU 上,token 生成速度最高可达 Astra Standard 模式的 8 倍。
推荐理由:原文给出 Ultrafast 模式相对标准模式的生成速度提升与开放入口,读者可据此判断它对编码智能体循环的实际影响。
JetBrains 在 IDE 中开放 Air 的 Early Access Program,可作为插件从 JetBrains Marketplace 安装,或直接使用 JetBrains IDE 2026.3 EAP 版本。
推荐理由:JetBrains 官方给出 Air 在 IDE 中的并行会话、云端运行与数据流向说明,可据此判断现有编码工作流会如何变化。
Unsloth 发布 v0.1.901-beta,其 Studio 针对链接文件夹中的相同文件复用嵌入向量以提升性能。该版本提交已在 GitHub 上通过验证签名。
vLLM 发布 v0.31.0rc3,为 Model Runner V2 加入随机化 dummy inputs 支持(#58411)。该改动由 Robert Shaw 提交,并经 Claude Opus 5.5 等共同署名,属于候选版本更新。
Claude Agent SDK 发布 v0.2.163,内置 Claude CLI 更新至 2.1.286。该版本将 issue 分诊所用模型固定,以修复 CLI 新默认模型导致的失败,并可通过 pip install claude-agent-sdk==0.2.163 从 PyPI 安装。
微软研究院开发了一套端到端机器学习流水线,利用 L1 太阳风观测和 AE、Dst 指数预报,结合纬度、地质电导率与电网数据,为美国本土 66,935 座变电站生成 30-60 分钟前的局地空间天气风险估计。
Axolotl v0.20.0 发布,自 v0.19.0 以来累计 67 个 commit,新增 GGUF 导出、Ringmaster 上下文并行、原生 NVFP4 LoRA 和无 DeepEP 的专家并行。
vLLM 发布 vllm-proto 0.4.0,对应标签 proto-v0.4.0(提交 f28a508),该标签已通过提交者签名验证。此次发布附带 2 个资源文件。
vLLM 发布 v0.31.0rc2,修复 Mamba 在稀疏场景下 prompt-end prefill checkpoint 的保留问题。该版本为候选发布版,主要针对 Mamba 相关 bug 进行修正。
Google 分享了在 TPU 上将视频扩散模型稀疏注意力理论转化为端到端加速的案例。81 帧 720p 视频的序列长度达 50K 至 400K,从 720p 升至 1440p 时序列长度翻两番,全注意力在单层延迟中占比可从 55.5% 升至 88.2%。
TRL 发布 v1.14.1,修复了 vLLM 0.20 至 0.25 上首次权重同步时的 server 模式崩溃问题。该版本还修复了 vLLM server 模式下工具调用后每个样本只生成一个 completion 的问题,并让 CLI 脚本保留显式的 model_init_kwargs、正确响应 resume_from_checkpoint。
Unsloth 新增决策模型支持,可在本地运行 Laya(开源 Jev)回答是/否、多选和评分问题并输出概率,通过 Settings > API 启用 Decision API,支持 TypeSafe SDK 的 Jev 兼容 /v1/systemone 端点。
TensorRT-LLM 发布 v1.3.0rc29,新增对 Qwen3.5 全局 FP8 权重、Kimi K3 NVFP4 SiTU 的 CuTeDSL MoE 后端以及 DeepSeek V4 NVFP4 MLA 残差开关的支持。
PEFT 发布 v0.21.1,使 Tensor Parallel(TP)能够与 PEFT 正常配合工作,需搭配 Transformers ≥ 5.17.0 使用。该版本为小型更新,包含 #3614、#3790 两项改动。
CrewAI 发布 1.15.23,新增对 Gemini 3.8 Flash 的原生支持,并让 crewai eval 通过 AMP 评估最近一次追踪运行、记录而非打印结果。该版本还优化了平台集成设置体验、优先展示热门集成,并修复了追踪面板可见性、TUI 评估按钮、Bedrock 同步调用回退及 SQLite 连接关闭等问题。
Mistral 在慕尼黑开设德国中心,组建专注 Physics AI 与工业 AI 的研究团队,并计划到 2030 年建成 1 吉瓦欧洲算力。该中心将与 BMW 合作碰撞仿真与工程 AI、与 Siemens Energy 合作工业 AI 应用,并与慕尼黑工业大学(TUM)合作利用风洞设施开发汽车空气动力学数字孪生。
LMDeploy 发布 v0.18.0,新增输出与输入 logprobs 支持,并扩展 SM90 量化 GEMM、统一 TurboMind 线性执行。该版本为昇腾支持 glm52、为 qwen3.5 支持 dflash,同时加入 PyTorch 版 TurboMind W4A16 AWQ 线性后端原型与分段 CUDA graph 预填充。
Unsloth 发布面向 Linux x86_64、CUDA 13 的预编译 wheel,涵盖 flash-attn 2.8.4、causal-conv1d 1.7.0 和 mamba-ssm 2.3.2.post1,基于 PyTorch 2.13 与 2.14、Python 3.13 构建。
Claude Agent SDK 发布 v0.2.160,修复后台子智能体在轮次结果到达前完成时 stdin 被过早关闭、导致后续轮次报 "Stream closed" 的问题。
TRL v1.14.0 移除了 v1.13 引入的 trl.losses 模块,DPO、KTO、GRPO 改为通过 _ChunkedLogProbFunction 流式计算所选 token 的 log-probs,各自复用原有损失代码,不再重复实现损失数学。
Google 团队在 Google Cloud TPU 上用 MaxText 从零复现了 Ai2 的 Olmo 3 7B,覆盖 stage-1 预训练与 stage-2 mid-training anneal,并在留出指标上验证匹配。
Google Cloud API Gateway 进入 Public Preview,可作为远程 MCP 服务器,在已有 OpenAPI 3.0.x 或 3.1.x 规范上通过 x-google-api-management.mcp 注解,把现有 REST 操作暴露为智能体可调用的 MCP 工具,无需另建服务器。
推荐理由:原文给出把现有 REST API 直接暴露为 MCP 工具的具体配置步骤与限制,可据此评估改造成本。
LangGraph CLI 发布 0.4.32.dev0 开发版本,该版本由 GitHub Actions 于 9 月 23 日构建并签名发布。更新内容为 cli==0.4.32 以来的变更,附带 2 个资源文件。
GitHub Copilot 应用重建了 pull request 视图,以应对超大 diff 与评论带来的渲染压力,实测对象是一个包含 2,200 个文件、超 100 万行改动和 400 多条行内评论的开源 pull request。方案将文档高度拆成确定性的代码几何与动态块几何两部分:代码行高可提前精确计算,评论、草稿和回复框则按块惰性测量,并锚定到文件、行号和侧别而非像素坐标。
LangGraph CLI 发布 0.4.32,新增将自托管部署置于 listener 的能力,并为自托管部署加入 --image-uri 参数。该版本还更新 langgraph deploy 命令改用 agent_id 和 environment 参数,并澄清 agent flags、支持环境变量默认值。
Google Beam 正式扩展至美国、加拿大、英国、法国、德国和日本六国,由 18 家渠道合作伙伴支持部署,旗舰硬件为 HP Dimension with Google Beam。
微软研究院对移动操作机器人工作负载做了首次系统性测量,发现把物理 AI 推理从机器人端侧 GPU 卸载到边缘或云端 GPU 可提升任务成功率、支持更大模型并延长续航。
推荐理由:微软研究院系统测量了机器人端侧 GPU 推理的瓶颈,并给出可复用的 Kubernetes 卸载工具链,读者可据此判断物理 AI 的部署取舍。
Google Private AI Compute 团队公布为 Private AI Compute 平台引入私有服务端记忆的技术方案,让云端 AI 在跨设备场景下持久保留上下文,同时维持端侧级隐私标准。
推荐理由:Google 公开了 Private AI Compute 的持久化服务端记忆方案,读者可了解云端 AI 如何在保留跨设备上下文的同时维持端侧级隐私。
Unsloth 现已支持本地运行 Qwen-Image-2.1,该版本支持图像编辑与图像生成,并提供 Fast FP8 与 GGUF 修复。此次更新新增自定义 Agent Skills,可复用 Claude Code 和 .agents 文件夹中的技能,长推理块速度提升至 60 FPS(此前 30 FPS)。
TensorRT-LLM 发布 v1.3.0rc28,新增 DFlash 2 支持并为 Llama、Llama4 默认启用 KV-cache manager V2,同时扩展 Qwen3.8-Flash-Next 的 disaggregation、MegaMoE 与 GVR index reuse 支持。
Claude Agent SDK v0.2.158 新增 ClaudeAgentOptions.verbatim_prompts 选项(默认 False),开启后用户消息原样传给 CLI,不做 @path 文件展开和斜杠命令分发,可防止提示词中内联的不可信文本触发意外文件读取或命令执行。该选项需 CLI 2.1.248+,旧版本会记录警告,并已内置更新至 Claude CLI 2.1.280。
Cursor 发布 Rollouts 和 Security Review 两个机器人,面向代码交付的最后环节,今日起在 Teams 和 Enterprise 套餐提供。
推荐理由:Cursor 把部署监控与安全审查做成两个 PR 机器人,读者可据此判断代码上线环节的自动化边界。
Sourcegraph 认为,AI 编程已把 prompt-to-PR 流程打磨到极致,但大型企业存量代码库的维护仍完全未解决。作者提出"自主代码库"构想:由触发器(定时任务、新 CVE、生产日志异常等)驱动可调用的智能体函数(全库 Deep Search、推送 PR、批量变更),组成确定性有向图工作流。未来企业将转向范围更窄、授权更小的智能体组合,而非继续泛化通用 harness。
SGLang 发布 v0.5.20,包含 237 位贡献者的 713 个 PR,新增 GLM-5.3-Flash、Qwen3.8-Flash-Next、Hy4-Preview、K2 Horizon、Nanbeige4.2 等模型支持。
TensorRT-LLM 发布 v1.3.0rc27,新增 MiniMax-H3 VisualGen 文生视频与首尾帧生视频支持(BF16 和 FP8 blockwise),并支持 Nemotron 3.5 Super VL 多模态服务。
JetBrains 分享了其语义代码搜索平台 Air Context 的 RAG 流水线构建经验,首篇聚焦解析、分块与向量化。团队指出固定行数分块会把 import 语句和函数内容等无关代码混在一起导致检索错误,因此采用基于解析器的结构感知分块,利用 Java 等语言的类结构约定划分语义单元。该平台旨在让 LLM 智能体按语义而非关键词检索代码,获得可引用的仓库证据。
CrewAI 发布 1.15.22,新增连接标识符别名支持,并将 OpenRouter 纳入支持的嵌入向量提供商。该版本在 crew 搭建阶段校验平台集成,向 JSON crew 向导添加平台工具,并公开 CrewAI Platform 应用目录。此外还修复了 Azure 流式工具调用按 wire index 归类、Gemini 文件数据内容保留等问题。
DeepSpeed 发布 v0.19.7 补丁版本,为 ZeRO checkpoint 导出新增可配置 dtype,并修复 seq-first Ulysses all2all 输出布局、flops profiler 统计重复计数等问题。