Ollama v0.40.0-rc5 发布:修复 MLX 近期更新补丁
Ollama 发布 v0.40.0-rc5,修复针对近期 MLX 更新的补丁(#18812)。该版本为候选发布版,提交已通过 GitHub 签名验证。
Ollama 发布 v0.40.0-rc5,修复针对近期 MLX 更新的补丁(#18812)。该版本为候选发布版,提交已通过 GitHub 签名验证。
Ollama 发布 v0.40.0-rc4,本次更新包含 MLX 版本升级,并为单元测试添加 scopes 以降低内存占用。该版本为候选发布版(rc),提交已通过 GitHub 验证签名。
Google DeepMind 发布开放权重多模态嵌入模型 EmbeddingGemma 2,可将文本、图像、视频帧和音频映射到统一向量空间,参数量 740M,文本权重最低约 191MB 内存,完整多模态模型在 Google Pixel 11 Pro 上约 567MB。
推荐理由:EmbeddingGemma 2 把文本、图像、视频帧和音频映射到同一向量空间,并给出端侧内存与延迟数据,可据此判断本地多模态检索的落地边界。
Claude Code v2.1.290 发布,为 mod 的 turn.step hook 结果新增 serverToolUses 字段,记录 API 自身发起的工具调用及其 id、名称、输入和起止时间。
LangGraph 发布 1.2.13,集中修复 DeltaChannel 相关缺陷:不再为从未写入的 DeltaChannel 遍历历史,避免将废弃分支重放到 DeltaChannel fork,并在各 update_state 路径上保留 DeltaChannel 计数器。
NVIDIA Inception 计划中的多家初创公司正用 AI 覆盖乳腺癌筛查、风险评估与治疗规划全流程。iSono Health 的 FDA 认证 ATUSA 可穿戴 3D 超声系统约两分钟完成单侧乳房扫描,灵敏度比手持 2D 超声高 28%;Whiterabbit.ai 的 WRDensity 已用于数十万患者;Ataraxis AI 则用病理切片预测治疗反应与复发风险。
针对扩散 Transformer 长序列生成中稀疏注意力导致质量下降的问题,研究者提出免训练框架 MC-Sparse,通过缓存查询分组、KV 索引与稠密-稀疏注意力残差并在去噪步骤间复用,实现更高保真度。在 Minimax-H3-Base 上取得 1.80 倍去噪加速,3D 资产生成上达 2.32 倍,质量损失可忽略。
DeepSpeed 合并 PR #8497,为连续批处理 rollout 新增可选的 decode front 对齐路径:开启 align_decode_fronts 后按 attention mask 推导有效 prompt 长度、从长到短排序并右对齐 prefill,同时裁剪无效 cache 列,默认仍保持等宽填充布局。
Claude Code v2.1.289 修复了复合 shell 命令嵌套部分的 deny/ask 规则在托管机器上覆盖用户安装 mod 审批的问题,并解决了短代码块含大量未闭合标签或深层嵌套 ${} 替换时终端卡死。
vLLM 发布 v0.31.0rc5,在 requirements 中为 Transformers 版本添加了上限约束。该改动由 Isotr0py 提交、Harry Mellor 共同署名,并从主分支 cherry-pick 而来。
SGLang 发布 v0.5.21,合并 227 位贡献者的 779 个 PR,新增 DeepSeek-V4.1 Flash、GigaChat 3.5、MiMo-V2.6、Qwen-Image 2.1、FLUX 3 Action 等模型支持。
GitHub Copilot 代码审查现已支持通过 REST 和 GraphQL API 发起请求,并可为每次请求单独设置审查强度。默认审查强度已改为 Balanced,于 2026 年 9 月 28 日生效,此前显式选择 Lite 的设置保持不变。该功能已面向 Copilot Pro、Pro+、Max、Business 和 Enterprise 计划全面开放。
GitHub Copilot 于 2026 年 10 月 2 日在所有体验中弃用 Gemini 3.5 Flash、Gemini 3.6 Flash、Kimi K2.7 Code 和 Claude Opus 4.7,建议分别改用 Gemini 3.8 Flash、Kimi K3 和 Claude Opus 5.5。
MIT Technology Review 报告指出,企业 AI 的规模化瓶颈是结构性的,全球 AI 投资 2026 年将达 2.5 万亿美元,同比增长 44%。报告提出“agentic shift”,主张企业先重构流程与数据基础设施,采用可组合架构,并解决 AI 主权问题,让数据无需迁移即可被 AI 智能体调用。
OpenAI Agents SDK 发布 v0.23.1 补丁版本,修复发布测试并刷新必需的 readiness 检查,SDK 运行时源码相对 v0.23.0 仅改动版本号字符串。
Google 发布新一代联邦学习系统,用可信执行环境(TEE)为数据匿名化提供可验证、可审计的保证,Gboard 已采用该系统上线英语和日语下一词预测模型。新系统把客户端梯度计算移到服务端,训练时间瓶颈从设备可用性转为 TEE 资源,此前每个模型训练需 1-2 个月。
推荐理由:Google 公布基于 TEE 的新一代联邦学习系统设计,并给出 Gboard 已上线的实际部署效果。
Airbnb CTO Ahmad Al-Dahle 接受 Latent Space 采访,介绍公司向 AI-native 转型的实践:目前 60% 的代码由 AI 编写,功能交付量同比增长近 80%,工程师人均 PR 吞吐量提升约 1.6 倍。
GitHub Copilot 本周为 Pro、Pro+、Max、Business 和 Enterprise 用户上线 Claude Sonnet 5.5,并为 Pro+、Max、Business 和 Enterprise 用户提供 GPT-6.1 Sol。
推荐理由:汇总了 Copilot 本周新增模型、动态工作流与桌面自动化能力,可据此判断智能体工作流的可用边界。
NVIDIA 将于本月通过 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 等厂商推出 64GB 统一内存版 DGX Spark,10 月 23 日开售,起售价 4,999 美元,保留 GB10 Grace Blackwell 超级芯片、DGX OS 与完整 NVIDIA AI 软件栈,支持最高 1000 亿参数模型在设备端运行。
推荐理由:原文给出 64GB 新配置的定价、上市时间与双机集群方式,读者可据此判断本地跑大模型的硬件门槛。
vLLM 发布 v0.31.0rc4,修复了 HiSparse 在 FULL graphs 下 MTP 接受率崩溃的问题。该版本为候选发布版,主要针对上述 bug 进行修补。
Unsloth Desktop 新增 Cmd/Ctrl+P 命令面板,支持分享 GGUF 运行设置,并让 Laya 决策模型短请求提速最高 4.1 倍。
ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例与更强教师的成功示范,自动生成并验证新的可执行训练任务,并随模型进步动态调整课程。该流程以 EnterpriseOps Gym 数据集为例演示,生成的任务需满足可行性、真实性与难度三项要求,验证器则需保证一致性、可靠性与完整性。
OpenAI 在 API 以及符合条件的 ChatGPT Work 和 Codex 用户中上线 GPT-6 Astra Ultrafast,该模式运行在 NVIDIA Blackwell GPU 上,token 生成速度最高可达 Astra Standard 模式的 8 倍。
推荐理由:原文给出 Ultrafast 模式相对标准模式的生成速度提升与开放入口,读者可据此判断它对编码智能体循环的实际影响。
JetBrains 在 IDE 中开放 Air 的 Early Access Program,可作为插件从 JetBrains Marketplace 安装,或直接使用 JetBrains IDE 2026.3 EAP 版本。
推荐理由:JetBrains 官方给出 Air 在 IDE 中的并行会话、云端运行与数据流向说明,可据此判断现有编码工作流会如何变化。
Unsloth 发布 v0.1.901-beta,其 Studio 针对链接文件夹中的相同文件复用嵌入向量以提升性能。该版本提交已在 GitHub 上通过验证签名。
vLLM 发布 v0.31.0rc3,为 Model Runner V2 加入随机化 dummy inputs 支持(#58411)。该改动由 Robert Shaw 提交,并经 Claude Opus 5.5 等共同署名,属于候选版本更新。
Claude Agent SDK 发布 v0.2.163,内置 Claude CLI 更新至 2.1.286。该版本将 issue 分诊所用模型固定,以修复 CLI 新默认模型导致的失败,并可通过 pip install claude-agent-sdk==0.2.163 从 PyPI 安装。
微软研究院开发了一套端到端机器学习流水线,利用 L1 太阳风观测和 AE、Dst 指数预报,结合纬度、地质电导率与电网数据,为美国本土 66,935 座变电站生成 30-60 分钟前的局地空间天气风险估计。
Axolotl v0.20.0 发布,自 v0.19.0 以来累计 67 个 commit,新增 GGUF 导出、Ringmaster 上下文并行、原生 NVFP4 LoRA 和无 DeepEP 的专家并行。
vLLM 发布 vllm-proto 0.4.0,对应标签 proto-v0.4.0(提交 f28a508),该标签已通过提交者签名验证。此次发布附带 2 个资源文件。
vLLM 发布 v0.31.0rc2,修复 Mamba 在稀疏场景下 prompt-end prefill checkpoint 的保留问题。该版本为候选发布版,主要针对 Mamba 相关 bug 进行修正。
Google 分享了在 TPU 上将视频扩散模型稀疏注意力理论转化为端到端加速的案例。81 帧 720p 视频的序列长度达 50K 至 400K,从 720p 升至 1440p 时序列长度翻两番,全注意力在单层延迟中占比可从 55.5% 升至 88.2%。
TRL 发布 v1.14.1,修复了 vLLM 0.20 至 0.25 上首次权重同步时的 server 模式崩溃问题。该版本还修复了 vLLM server 模式下工具调用后每个样本只生成一个 completion 的问题,并让 CLI 脚本保留显式的 model_init_kwargs、正确响应 resume_from_checkpoint。
Unsloth 新增决策模型支持,可在本地运行 Laya(开源 Jev)回答是/否、多选和评分问题并输出概率,通过 Settings > API 启用 Decision API,支持 TypeSafe SDK 的 Jev 兼容 /v1/systemone 端点。
TensorRT-LLM 发布 v1.3.0rc29,新增对 Qwen3.5 全局 FP8 权重、Kimi K3 NVFP4 SiTU 的 CuTeDSL MoE 后端以及 DeepSeek V4 NVFP4 MLA 残差开关的支持。
PEFT 发布 v0.21.1,使 Tensor Parallel(TP)能够与 PEFT 正常配合工作,需搭配 Transformers ≥ 5.17.0 使用。该版本为小型更新,包含 #3614、#3790 两项改动。
CrewAI 发布 1.15.23,新增对 Gemini 3.8 Flash 的原生支持,并让 crewai eval 通过 AMP 评估最近一次追踪运行、记录而非打印结果。该版本还优化了平台集成设置体验、优先展示热门集成,并修复了追踪面板可见性、TUI 评估按钮、Bedrock 同步调用回退及 SQLite 连接关闭等问题。
Mistral 在慕尼黑开设德国中心,组建专注 Physics AI 与工业 AI 的研究团队,并计划到 2030 年建成 1 吉瓦欧洲算力。该中心将与 BMW 合作碰撞仿真与工程 AI、与 Siemens Energy 合作工业 AI 应用,并与慕尼黑工业大学(TUM)合作利用风洞设施开发汽车空气动力学数字孪生。
Import AI 第 474 期聚焦三项内容:Michael Levin 提出心智是来自柏拉图式模式空间的模式,身体与机器只是其进入物理世界的接口。智谱启动了一个"外层 RSI 循环",探索递归自我改进。此外还讨论了将 TPU 部署到太空,以及机器人领域正为 LLM 时刻做准备但缺少通用算法。
LMDeploy 发布 v0.18.0,新增输出与输入 logprobs 支持,并扩展 SM90 量化 GEMM、统一 TurboMind 线性执行。该版本为昇腾支持 glm52、为 qwen3.5 支持 dflash,同时加入 PyTorch 版 TurboMind W4A16 AWQ 线性后端原型与分段 CUDA graph 预填充。