Claude Code v2.1.293 发布,默认 Haiku 模型换为 Claude Haiku 5.5
Claude Code v2.1.293 将 Claude Haiku 5.5(claude-haiku-5-5)设为 Anthropic API 上的默认 Haiku 模型,支持 1M 上下文,定价为每 Mtok $0.10/$0.50,超过 100K 的提示词为 $0.50/$2.50。
Claude Code v2.1.293 将 Claude Haiku 5.5(claude-haiku-5-5)设为 Anthropic API 上的默认 Haiku 模型,支持 1M 上下文,定价为每 Mtok $0.10/$0.50,超过 100K 的提示词为 $0.50/$2.50。
GitHub 发布与 Microsoft Applied Sciences 联合微调的 ModernBERT 分类器,把 push protection 扩展到无固定格式的密钥,可在 2 毫秒内评估一批候选密钥,据称能把可拦截的密钥数量提升一倍以上。
推荐理由:GitHub 用九个季度数据说明密钥泄露与人工修复的失衡,并给出把检测前移到 push 环节的模型方案。
GitHub 公布专用于密钥检测的微调模型,可读取上下文代码识别凭据,包括没有固定 token 格式的密码,且不生成代码或文本。该模型已自动升级现有 AI 检测密码告警,AI 推送保护进入私有预览,Copilot CLI 与 Copilot App 的 /security-review 命令也将加入密钥分类器检查。
推荐理由:GitHub 把微调后的密钥检测模型接入告警、推送保护和 Copilot 安全审查,可据此了解各功能的开放范围与计费方式。
微软研究院开源 Agent Lightning v1.0,一个约 3500 行代码的轻量智能体强化学习框架,提出 Harnessed Agentic RL 范式,让部署时使用的同一套 agent harness 直接参与训练,无需在训练框架内重新实现智能体。
推荐理由:微软开源 Agent Lightning v1.0,用约 3500 行代码把真实 harness 直接接入 RL 训练,并给出 6000 样本的编码智能体训练结果。
AWS 提出 Agentic Value Model,用于替代为 RPA 设计的传统 ROI 模型,从时间节省、异常处理、决策质量、变更韧性与维护经济性四个维度衡量 agentic automation 的价值。
Qlik 基于 Amazon Bedrock 打造 Qlik Answers,为全球超 4 万名客户提供带来源引用的自然语言问答,2026 年 2 月正式可用后,其 Discovery Agent 已为客户发现超 10 万条洞察。
AWS 展示了一套自动化修复工作流,用 Amazon EventBridge 接收 AWS DevOps Agent 的调查完成事件,再由 AWS Lambda Durable Functions 调用 Amazon Bedrock 分析根因并从预批准的 Lambda 工具白名单中提出修复方案。
GitHub Copilot 的本地沙箱功能正式可用,覆盖 GitHub Copilot CLI、GitHub Copilot 应用以及使用 Agent Host 的 VS Code 会话。
推荐理由:官方说明本地沙箱在 CLI、应用与 VS Code 中正式可用,读者可据此了解智能体工作流的权限边界如何落地。
GitHub Copilot CLI 1.0.94-0 起可用 /model 发现本地运行的 Ollama 实例中受支持的模型,与已配置模型和 GitHub Copilot 云端模型并列展示。
AWS 设计了一个为期六周、每周约四小时的结构化项目,让非工程背景的业务人员用 Amazon Bedrock、Amazon Bedrock AgentCore 和 Strands Agents SDK 构建可运行的 AI 原型。
LangGraph CLI 发布 0.4.33 版本,新增 `--image-uri` 参数,支持直接部署已推送的镜像,并加入 `langgraph deploy listeners list` 命令。该版本还修复了带凭据的 Git 依赖被拒绝的问题,并升级了 virtualenv、urllib3、pyjwt 等依赖。
Google 推出 Developer Knowledge API 生态,为 AI 智能体和开发工具提供 Google Cloud、Firebase、Android 等官方文档的结构化访问,取代网页抓取。
Claude Agent SDK 发布 v0.2.164,内置 Claude CLI 升级至 2.1.292,可通过 pip install claude-agent-sdk==0.2.164 安装。
GitHub 修复了 Copilot 使用指标中智能体活动被漏计的问题:部分 IDE 将 Copilot 智能体会话迁移到 Copilot SDK 后未标识来源 IDE,导致活动无法正确归属,部分还被计入 Copilot CLI。
vLLM 发布 v0.31.1rc0,新增按缓存层级(cache tier)暴露缓存提示词 token 的指标(#56318)。该改动由 Cam Quilici 提交,Nick Hill 与 Yifan Qiao 共同参与。
Ollama 发布 v0.40.0,在 Apple Silicon 设备上,MLX 运行时支持的模型架构将自动改用 MLX 运行。此次支持的模型包括 qwen3.8、gemma4、qwen3.6 和 qwen3.5,决策模型 Nimble、tev1、clef、clef-flash 也已上线 MLX,嵌入模型 embeddinggemma-2 同样获得 MLX 支持。
推荐理由:Ollama 在 Apple Silicon 上默认切换到 MLX 运行时,读者可据此了解本地部署的默认行为变化与已支持模型范围。
Unsloth 发布 v0.1.903-beta,在聊天旁加入内置浏览器面板,文件、网页和模型生成的 HTML 都以标签页打开,并支持对页面内容提问。该版本同时支持 Google DeepMind 的多模态嵌入模型 EmbeddingGemma 2,提供 740M 参数版本(纯文本 270M)、100+ 语言和 8K 上下文窗口,代码任务比上一代提升约 14%。
推荐理由:Unsloth 一次更新同时加入内置浏览器、EmbeddingGemma 2 支持与语音克隆页面,可据此判断本地微调工具链的边界扩展。
Ollama 发布 v0.40.0-rc6,在 MLX 推理后端实现 EmbeddingGemma2Model 架构,包含 24 层双向文本编码器、PLE 以及共享的 gemma4 视觉/音频塔,输出采用 mean-pool + L2。该版本的 /api/embed 接口支持通过 input dicts 传入逐项媒体内容。
Google Earth AI 的 Population Dynamics Foundation Model(PDFM)将匿名搜索趋势、人口流动、建成环境密度和环境数据压缩为按月更新的位置嵌入向量,无需任务微调即可直接接入现有流行病学模型。
LangGraph SDK 发布 0.4.6 版本,修复了 sdk-py 中 thread stream 请求对 thread_id 和 assistant_id 的百分号编码问题。此次更新还包含 langgraph 1.2.13 版本发布,以及 sdk-py 依赖项的小版本与补丁更新,并将 urllib3 从 2.7.0 升级至 2.8.0。
vLLM 发布 v0.31.0,含 307 位贡献者的 717 个提交,重点优化 DeepSeek-V4.1-Flash:FlashMLA mega attention 搭配 NVFP4 压缩 KV cache 成为 SM100 默认配置。
Claude Code 发布 v2.1.291,修复了 2.1.290 中云会话可能丢失权限提示回答的回归问题,以及 2.1.288 中退出会话时最后几条消息可能丢失的回归问题。该版本自上一版以来包含 7 个提交。
Ollama 发布 v0.40.0-rc5,修复针对近期 MLX 更新的补丁(#18812)。该版本为候选发布版,提交已通过 GitHub 签名验证。
Ollama 发布 v0.40.0-rc4,本次更新包含 MLX 版本升级,并为单元测试添加 scopes 以降低内存占用。该版本为候选发布版(rc),提交已通过 GitHub 验证签名。
Google DeepMind 发布开放权重多模态嵌入模型 EmbeddingGemma 2,可将文本、图像、视频帧和音频映射到统一向量空间,参数量 740M,文本权重最低约 191MB 内存,完整多模态模型在 Google Pixel 11 Pro 上约 567MB。
推荐理由:EmbeddingGemma 2 把文本、图像、视频帧和音频映射到同一向量空间,并给出端侧内存与延迟数据,可据此判断本地多模态检索的落地边界。
Claude Code v2.1.290 发布,为 mod 的 turn.step hook 结果新增 serverToolUses 字段,记录 API 自身发起的工具调用及其 id、名称、输入和起止时间。
LangGraph 发布 1.2.13,集中修复 DeltaChannel 相关缺陷:不再为从未写入的 DeltaChannel 遍历历史,避免将废弃分支重放到 DeltaChannel fork,并在各 update_state 路径上保留 DeltaChannel 计数器。
NVIDIA Inception 计划中的多家初创公司正用 AI 覆盖乳腺癌筛查、风险评估与治疗规划全流程。iSono Health 的 FDA 认证 ATUSA 可穿戴 3D 超声系统约两分钟完成单侧乳房扫描,灵敏度比手持 2D 超声高 28%;Whiterabbit.ai 的 WRDensity 已用于数十万患者;Ataraxis AI 则用病理切片预测治疗反应与复发风险。
针对扩散 Transformer 长序列生成中稀疏注意力导致质量下降的问题,研究者提出免训练框架 MC-Sparse,通过缓存查询分组、KV 索引与稠密-稀疏注意力残差并在去噪步骤间复用,实现更高保真度。在 Minimax-H3-Base 上取得 1.80 倍去噪加速,3D 资产生成上达 2.32 倍,质量损失可忽略。
DeepSpeed 合并 PR #8497,为连续批处理 rollout 新增可选的 decode front 对齐路径:开启 align_decode_fronts 后按 attention mask 推导有效 prompt 长度、从长到短排序并右对齐 prefill,同时裁剪无效 cache 列,默认仍保持等宽填充布局。
Claude Code v2.1.289 修复了复合 shell 命令嵌套部分的 deny/ask 规则在托管机器上覆盖用户安装 mod 审批的问题,并解决了短代码块含大量未闭合标签或深层嵌套 ${} 替换时终端卡死。
vLLM 发布 v0.31.0rc5,在 requirements 中为 Transformers 版本添加了上限约束。该改动由 Isotr0py 提交、Harry Mellor 共同署名,并从主分支 cherry-pick 而来。
SGLang 发布 v0.5.21,合并 227 位贡献者的 779 个 PR,新增 DeepSeek-V4.1 Flash、GigaChat 3.5、MiMo-V2.6、Qwen-Image 2.1、FLUX 3 Action 等模型支持。
GitHub Copilot 代码审查现已支持通过 REST 和 GraphQL API 发起请求,并可为每次请求单独设置审查强度。默认审查强度已改为 Balanced,于 2026 年 9 月 28 日生效,此前显式选择 Lite 的设置保持不变。该功能已面向 Copilot Pro、Pro+、Max、Business 和 Enterprise 计划全面开放。
GitHub Copilot 于 2026 年 10 月 2 日在所有体验中弃用 Gemini 3.5 Flash、Gemini 3.6 Flash、Kimi K2.7 Code 和 Claude Opus 4.7,建议分别改用 Gemini 3.8 Flash、Kimi K3 和 Claude Opus 5.5。
OpenAI Agents SDK 发布 v0.23.1 补丁版本,修复发布测试并刷新必需的 readiness 检查,SDK 运行时源码相对 v0.23.0 仅改动版本号字符串。
Google 发布新一代联邦学习系统,用可信执行环境(TEE)为数据匿名化提供可验证、可审计的保证,Gboard 已采用该系统上线英语和日语下一词预测模型。新系统把客户端梯度计算移到服务端,训练时间瓶颈从设备可用性转为 TEE 资源,此前每个模型训练需 1-2 个月。
推荐理由:Google 公布基于 TEE 的新一代联邦学习系统设计,并给出 Gboard 已上线的实际部署效果。
GitHub Copilot 本周为 Pro、Pro+、Max、Business 和 Enterprise 用户上线 Claude Sonnet 5.5,并为 Pro+、Max、Business 和 Enterprise 用户提供 GPT-6.1 Sol。
推荐理由:汇总了 Copilot 本周新增模型、动态工作流与桌面自动化能力,可据此判断智能体工作流的可用边界。
NVIDIA 将于本月通过 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 等厂商推出 64GB 统一内存版 DGX Spark,10 月 23 日开售,起售价 4,999 美元,保留 GB10 Grace Blackwell 超级芯片、DGX OS 与完整 NVIDIA AI 软件栈,支持最高 1000 亿参数模型在设备端运行。
推荐理由:原文给出 64GB 新配置的定价、上市时间与双机集群方式,读者可据此判断本地跑大模型的硬件门槛。
vLLM 发布 v0.31.0rc4,修复了 HiSparse 在 FULL graphs 下 MTP 接受率崩溃的问题。该版本为候选发布版,主要针对上述 bug 进行修补。