Ollama v0.40.2 发布:旧模型后台自动升级至 llama.cpp
Ollama v0.40.2 让旧版本下载的模型在首次运行时后台自动升级,以在 llama.cpp 上获得更好性能与兼容性,并保留原始副本作为备份以便安全降级。该版本还修复了 ollama list 对已升级模型重复显示的问题,ollama launch claude 现使用模型完整上下文长度。备份模型将在未来版本自动清除。
Ollama v0.40.2 让旧版本下载的模型在首次运行时后台自动升级,以在 llama.cpp 上获得更好性能与兼容性,并保留原始副本作为备份以便安全降级。该版本还修复了 ollama list 对已升级模型重复显示的问题,ollama launch claude 现使用模型完整上下文长度。备份模型将在未来版本自动清除。
llama.cpp 发布 b11515 版本,为 SYCL 后端加入 Q5_K 重排布局的 MMVQ 与融合 GLU 支持。该版本同步更新 macOS、Linux、Windows、Android 及 openEuler 等多平台构建产物,覆盖 CUDA 12/13、ROCm 10.0、Vulkan、OpenVINO、SYCL FP32/FP16 等后端。
OpenAI Codex 发布 0.163.0-alpha.2 预发布版本,该版本自上一版本以来包含 6 个提交。这是 rust-v0.163.0-alpha.2 的预发布构建,具体功能变更未在发布说明中列出。
CrewAI 发布 1.15.26,修复了 rwlock 获取被中断时的所有权保留问题、文档站点源 URL 未保留的问题,以及 log-tasks-outputs 中任务输出显示实际输出的问题。该版本还更新了 v1.15.25 的快照和更新日志。
llama.cpp 发布 b11514 版本,修复了 Musa FWHT 问题(#30167)。该版本继续提供覆盖 macOS、Linux、Windows、Android 及 openEuler 的多平台构建,支持 CUDA 12/13、ROCm 10.0、Vulkan、SYCL、OpenVINO 等后端,其中 macOS Intel 与 openEuler 构建处于 DISABLED 状态。
TRL v1.15.0 引入默认开启的融合 LM head,用 Triton kernel 分块投影隐藏状态、直接归约出 per-token log-probs 和熵,不再构建 [batch, seq, vocab] logits 张量。
llama.cpp 发布 b11513,为 CUDA 后端改进 top-k 算法选择:按形状在 bitonic、radix select 与 DeviceTopK/CUB argsort 之间切换,阈值可在构建时覆盖。
OpenAI Codex 发布 0.162.0,在启用 worktree 功能后,可从受信任的本地项目创建和列出托管 Git worktree,并支持在智能体 Command Center 中用 p 键置顶任务。
llama.cpp 发布 b11512,修复 DFlash 输出头共享问题,改为从 GGUF metadata 读取绑定输出权重,并共享绑定词嵌入 metadata,同时移除 DFlash 嵌入头回退逻辑。相关改动由 Codex 协助完成。
llama.cpp 发布 b11511 版本,修复了 CUDA 后端中 MMQ 的越界读取(out-of-bounds reads)问题(#29953)。该版本继续提供覆盖 macOS、Linux、Windows、Android 及 openEuler 的多平台构建,包括 CUDA 12.8/13.4、ROCm 10.0、Vulkan、SYCL、OpenVINO 等后端。
llama.cpp 发布 b11510,CUDA 后端新增循环 PAD kernel,可处理超过 65535 行或切片的场景。该版本同步更新 macOS/iOS、Linux、Android、Windows 及 openEuler 等多平台构建,涵盖 CUDA 12.8/13.4、ROCm 10.0、Vulkan、SYCL、OpenVINO 等后端。
Unsloth 发布 v0.1.905-beta,可用 QLoRA 把任意文本或视觉 LLM 训练成 Jev 风格决策模型,决策准确率从 30% 提升到 80%。
推荐理由:Unsloth 把决策模型训练、测试、导出到部署串成一条链路,并给出准确率从 30% 到 80% 的对照。
Ollama v0.40.2-rc0 在列表输出中隐藏了重复与降级保护条目。加载需要 llama.cpp 补丁集的旧版 GGUF 时,Ollama 会在磁盘上做惰性转换,并临时保留新旧两份 GGUF、创建影子 v1 manifest 标签,以防降级后的服务器删除新 blob。这些旧副本将在未来版本中移除以回收磁盘空间。
llama.cpp 发布 b11509,修复 CUDA 后端 CCCL 版本守卫在 4.x 上误判的问题:旧逻辑分别比较主次版本号,导致 CCCL 4.x 下 STRIDED_ITERATOR_AVAILABLE 未定义,argsort 静默回退到 init_offsets 路径,仅损失性能而不报错。
llama.cpp 发布 b11507 版本,新增 MoE 缓存跨多 GPU 支持(#30112)。该版本继续提供 macOS、Linux、Windows、Android 及 openEuler 等多平台构建,覆盖 CUDA 12/13、ROCm 10.0、Vulkan、SYCL、OpenVINO 等后端。
JetBrains 发布 Mellum2.1,这是其 6 月开源的 12B MoE 模型的新版本,架构不变,仍为 2.5B 激活参数、Apache 2.0 许可。
推荐理由:JetBrains 开源编码智能体模型 Mellum2.1,读者可了解其 RL 后训练路线与自托管部署方式。
OpenAI Codex 发布 0.162.0-alpha.17.2 预发布版本,自上一版本以来 main 分支新增 150 个提交。该版本由 github-actions 于 10 月 8 日发布,附带 178 个资源文件。
Unsloth 发布 v0.1.904-beta,支持用 QLoRA 将任意文本或视觉 LLM 训练成 Jev 风格决策模型,决策准确率从 30% 提升到 80%,并可在 Unsloth 内完成训练、测试、导出与部署。
OpenAI Codex 发布 0.162.0-alpha.18.1 预发布版本,自上一版本以来主分支新增 113 个提交。该版本由 github-actions 于 10 月 8 日发布,附带 178 项资源文件。
Ollama 发布 v0.40.1,新增代理云端用量与余额 API,并移除 CLI 引导中的账户步骤。该版本修复了 Windows 上 llama 读取超过 2GiB 的问题,同时避免 Windows 上的符号链接,并清理了 README 中的失效链接。
Google AI Edge 团队以 Apache 2.0 协议开源端侧 GPU 计算引擎 ML Drift,它抽象 OpenGL ES、OpenCL、Metal 和 WebGPU,作为 LiteRT 的核心 GPU 加速引擎,也可独立使用。
推荐理由:Google 开源端侧 GPU 推理引擎 ML Drift,并给出 Chrome、YouTube Shorts、Adobe 等迁移后的实测提速数据。
CrewAI 发布 1.15.25 版本,由 lorenzejay 于 10 月 7 日发布,自上一版本以来 main 分支新增 7 个提交。该版本为不可变发布(Immutable release),仅发布标题和说明可修改。
Ollama 发布 v0.40.1-rc0,该版本移除了此前携带的 metal residency 补丁,因为相关改动已进入上游(#18854)。
CrewAI 发布 1.15.24,新增 crewai eval 功能,可在由智能体运行时打印 markdown 简报,并支持 --models 与 llm_overlay 按角色切换模型。该版本还加入 Oracle 集成、实验性的 turn 与 reply 身份、实验性 job 生命周期与 runner,并修复 crewai eval 未通过门禁时以退出码 1 结束等问题。
Liquid AI 发布 d1 决策模型家族的两款开源权重模型 d1-3B 和 d1-omni-600M(实验性)。
推荐理由:Liquid AI 开源两款决策模型,给出端侧延迟与七项基准对比,可判断小模型做结构化决策的可行性。
微软研究院开源 Agent Lightning v1.0,一个约 3500 行代码的轻量智能体强化学习框架,提出 Harnessed Agentic RL 范式,让部署时使用的同一套 agent harness 直接参与训练,无需在训练框架内重新实现智能体。
推荐理由:微软开源 Agent Lightning v1.0,用约 3500 行代码把真实 harness 直接接入 RL 训练,并给出 6000 样本的编码智能体训练结果。
LangGraph CLI 发布 0.4.33 版本,新增 `--image-uri` 参数,支持直接部署已推送的镜像,并加入 `langgraph deploy listeners list` 命令。该版本还修复了带凭据的 Git 依赖被拒绝的问题,并升级了 virtualenv、urllib3、pyjwt 等依赖。
OpenAI Codex 发布 0.162.0-alpha.18 预发布版本,自上一版本以来主分支新增 113 个提交。该版本由 github-actions 于 10 月 7 日发布,标签为 rust-v0.162.0-alpha.18。
TRL 发布 v1.14.2 补丁,修复两处静默训练错误和三处崩溃。其中 #7505 影响默认生成路径(use_vllm=False)下的 GRPO、RLOO 和 Distillation。
Google DeepMind 发布 EmbeddingGemma 2,一个基于 Gemma 4 架构、Apache 2.0 许可的开源多模态嵌入模型,可把文本、图像、音频和视频映射到统一嵌入空间。
推荐理由:官方给出 740M 参数、模块化编码器与端侧内存占用,可据此判断本地多模态检索的落地门槛。
vLLM 发布 v0.31.1rc0,新增按缓存层级(cache tier)暴露缓存提示词 token 的指标(#56318)。该改动由 Cam Quilici 提交,Nick Hill 与 Yifan Qiao 共同参与。
Ollama 发布 v0.40.0,在 Apple Silicon 设备上,MLX 运行时支持的模型架构将自动改用 MLX 运行。此次支持的模型包括 qwen3.8、gemma4、qwen3.6 和 qwen3.5,决策模型 Nimble、tev1、clef、clef-flash 也已上线 MLX,嵌入模型 embeddinggemma-2 同样获得 MLX 支持。
推荐理由:Ollama 在 Apple Silicon 上默认切换到 MLX 运行时,读者可据此了解本地部署的默认行为变化与已支持模型范围。
Unsloth 发布 v0.1.903-beta,在聊天旁加入内置浏览器面板,文件、网页和模型生成的 HTML 都以标签页打开,并支持对页面内容提问。该版本同时支持 Google DeepMind 的多模态嵌入模型 EmbeddingGemma 2,提供 740M 参数版本(纯文本 270M)、100+ 语言和 8K 上下文窗口,代码任务比上一代提升约 14%。
推荐理由:Unsloth 一次更新同时加入内置浏览器、EmbeddingGemma 2 支持与语音克隆页面,可据此判断本地微调工具链的边界扩展。
Ollama 发布 v0.40.0-rc6,在 MLX 推理后端实现 EmbeddingGemma2Model 架构,包含 24 层双向文本编码器、PLE 以及共享的 gemma4 视觉/音频塔,输出采用 mean-pool + L2。该版本的 /api/embed 接口支持通过 input dicts 传入逐项媒体内容。
vLLM 发布 v0.31.0,含 307 位贡献者的 717 个提交,重点优化 DeepSeek-V4.1-Flash:FlashMLA mega attention 搭配 NVFP4 压缩 KV cache 成为 SM100 默认配置。
Ollama 发布 v0.40.0-rc5,修复针对近期 MLX 更新的补丁(#18812)。该版本为候选发布版,提交已通过 GitHub 签名验证。
Ollama 发布 v0.40.0-rc4,本次更新包含 MLX 版本升级,并为单元测试添加 scopes 以降低内存占用。该版本为候选发布版(rc),提交已通过 GitHub 验证签名。
Google 发布基于 Gemma 4 的 EmbeddingGemma 2,这是一个 Apache 2.0 许可的 sub-1B 开源嵌入模型,可将文本、代码、图像、视频和音频映射到统一的 768 维空间。
推荐理由:EmbeddingGemma 2 的模块化编码器与 MRL 截断方案,为多模态 RAG 的显存与存储取舍提供了可量化的参考。
DeepSpeed 合并 PR #8497,为连续批处理 rollout 新增可选的 decode front 对齐路径:开启 align_decode_fronts 后按 attention mask 推导有效 prompt 长度、从长到短排序并右对齐 prefill,同时裁剪无效 cache 列,默认仍保持等宽填充布局。
vLLM 发布 v0.31.0rc5,在 requirements 中为 Transformers 版本添加了上限约束。该改动由 Isotr0py 提交、Harry Mellor 共同署名,并从主分支 cherry-pick 而来。