微软发布会推出 Surface Laptop Ultra 与 Windows 11 新改动
微软在时隔两年的首场线下活动中发布新款 Surface Laptop Ultra,并公布 Windows 11 的一系列改动,同时展示本地 AI 与智能体工作流如何改变个人计算。
微软在时隔两年的首场线下活动中发布新款 Surface Laptop Ultra,并公布 Windows 11 的一系列改动,同时展示本地 AI 与智能体工作流如何改变个人计算。
Google AI Edge 团队以 Apache 2.0 协议开源端侧 GPU 计算引擎 ML Drift,它抽象 OpenGL ES、OpenCL、Metal 和 WebGPU,作为 LiteRT 的核心 GPU 加速引擎,也可独立使用。
推荐理由:Google 开源端侧 GPU 推理引擎 ML Drift,并给出 Chrome、YouTube Shorts、Adobe 等迁移后的实测提速数据。
Google 发布 AQuA(Ambient Quality Agent),一个在 Google Cloud 项目内旁路运行的质量智能体,按计划、部署后或按需扫描 Cloud Trace、Cloud Logging 或 BigQuery 中的生产轨迹,经采样、评审、聚类、验证、跟踪五阶段流水线输出可验证的故障洞察。
推荐理由:原文给出 AQuA 的五阶段流水线、成本数据和一次真实多智能体排查案例,可据此判断生产环境智能体质量监控的可行做法。
作者在 HuggingChat 中开启 ML-intern 模式,用提示词让它完成数据集构建、训练、评测和发布,两天内做出六个模型,总计算花费约 103 美元。
推荐理由:作者用 ML Intern 在两天内从零训练并发布六个模型,给出了提示词写法与逐项算力花费,可迁移到自己的训练流程。
Ollama 发布 v0.40.1-rc0,该版本移除了此前携带的 metal residency 补丁,因为相关改动已进入上游(#18854)。
Anthropic 最新的轻量模型 Claude Haiku 5.5 已在 GitHub Copilot 正式可用,面向 subagents、快速编辑和终端任务等高频场景。
推荐理由:读者可以了解 Claude Haiku 5.5 在 GitHub Copilot 中的可用范围与计费方式,以及它在编码任务上的初步表现。
AWS 宣布 Claude Haiku 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线。
推荐理由:AWS 官方给出 Haiku 5.5 的定位、成本变化与 Bedrock 接入方式,可据此判断它在多智能体分层中的分工。
在旧金山举行的 Windows AI and Surface 活动上,NVIDIA 与 Microsoft 宣布为 Windows PC 上的 AI 智能体共同设计软硬件,并公布 RTX Spark 笔记本即日开启预售、10 月 16 日开售,紧凑型台式机 11 月上市。
推荐理由:英伟达与微软把智能体运行所需的系统级容器和本地算力硬件一起端出,读者可据此判断本地智能体落地的软硬件门槛。
Amazon Quick 与 Amazon Bedrock Knowledge Bases 在原有预检索 ACL 过滤之上新增实时 ACL 校验,在查询时直接向权威数据源核实权限,避免依赖可能过期或映射错误的 ACL 数据。
Claude Code v2.1.293 将 Claude Haiku 5.5(claude-haiku-5-5)设为 Anthropic API 上的默认 Haiku 模型,支持 1M 上下文,定价为每 Mtok $0.10/$0.50,超过 100K 的提示词为 $0.50/$2.50。
GitHub 发布与 Microsoft Applied Sciences 联合微调的 ModernBERT 分类器,把 push protection 扩展到无固定格式的密钥,可在 2 毫秒内评估一批候选密钥,据称能把可拦截的密钥数量提升一倍以上。
推荐理由:GitHub 用九个季度数据说明密钥泄露与人工修复的失衡,并给出把检测前移到 push 环节的模型方案。
GitHub 公布专用于密钥检测的微调模型,可读取上下文代码识别凭据,包括没有固定 token 格式的密码,且不生成代码或文本。该模型已自动升级现有 AI 检测密码告警,AI 推送保护进入私有预览,Copilot CLI 与 Copilot App 的 /security-review 命令也将加入密钥分类器检查。
推荐理由:GitHub 把微调后的密钥检测模型接入告警、推送保护和 Copilot 安全审查,可据此了解各功能的开放范围与计费方式。
微软研究院开源 Agent Lightning v1.0,一个约 3500 行代码的轻量智能体强化学习框架,提出 Harnessed Agentic RL 范式,让部署时使用的同一套 agent harness 直接参与训练,无需在训练框架内重新实现智能体。
推荐理由:微软开源 Agent Lightning v1.0,用约 3500 行代码把真实 harness 直接接入 RL 训练,并给出 6000 样本的编码智能体训练结果。
AWS 提出 Agentic Value Model,用于替代为 RPA 设计的传统 ROI 模型,从时间节省、异常处理、决策质量、变更韧性与维护经济性四个维度衡量 agentic automation 的价值。
Qlik 基于 Amazon Bedrock 打造 Qlik Answers,为全球超 4 万名客户提供带来源引用的自然语言问答,2026 年 2 月正式可用后,其 Discovery Agent 已为客户发现超 10 万条洞察。
AWS 展示了一套自动化修复工作流,用 Amazon EventBridge 接收 AWS DevOps Agent 的调查完成事件,再由 AWS Lambda Durable Functions 调用 Amazon Bedrock 分析根因并从预批准的 Lambda 工具白名单中提出修复方案。
GitHub Copilot 的本地沙箱功能正式可用,覆盖 GitHub Copilot CLI、GitHub Copilot 应用以及使用 Agent Host 的 VS Code 会话。
推荐理由:官方说明本地沙箱在 CLI、应用与 VS Code 中正式可用,读者可据此了解智能体工作流的权限边界如何落地。
GitHub Copilot CLI 1.0.94-0 起可用 /model 发现本地运行的 Ollama 实例中受支持的模型,与已配置模型和 GitHub Copilot 云端模型并列展示。
AWS 设计了一个为期六周、每周约四小时的结构化项目,让非工程背景的业务人员用 Amazon Bedrock、Amazon Bedrock AgentCore 和 Strands Agents SDK 构建可运行的 AI 原型。
Latent Space 采访 Kubernetes 联合创造者 Craig McLuckie 和 Joe Beda,介绍其公司 Stacklok 转向基于 Kubernetes 的智能体方案,核心产品是 6 月起在 GitHub 开源的云原生 harness Mecatl。
LangGraph CLI 发布 0.4.33 版本,新增 `--image-uri` 参数,支持直接部署已推送的镜像,并加入 `langgraph deploy listeners list` 命令。该版本还修复了带凭据的 Git 依赖被拒绝的问题,并升级了 virtualenv、urllib3、pyjwt 等依赖。
Google 推出 Developer Knowledge API 生态,为 AI 智能体和开发工具提供 Google Cloud、Firebase、Android 等官方文档的结构化访问,取代网页抓取。
Claude Agent SDK 发布 v0.2.164,内置 Claude CLI 升级至 2.1.292,可通过 pip install claude-agent-sdk==0.2.164 安装。
GitHub 修复了 Copilot 使用指标中智能体活动被漏计的问题:部分 IDE 将 Copilot 智能体会话迁移到 Copilot SDK 后未标识来源 IDE,导致活动无法正确归属,部分还被计入 Copilot CLI。
Simon Willison 发布 llm-openai-decisions 0.1a0 插件,用于接入 OpenAI 在 DevDay 上宣布的 Decisions API。
vLLM 发布 v0.31.1rc0,新增按缓存层级(cache tier)暴露缓存提示词 token 的指标(#56318)。该改动由 Cam Quilici 提交,Nick Hill 与 Yifan Qiao 共同参与。
Ollama 发布 v0.40.0,在 Apple Silicon 设备上,MLX 运行时支持的模型架构将自动改用 MLX 运行。此次支持的模型包括 qwen3.8、gemma4、qwen3.6 和 qwen3.5,决策模型 Nimble、tev1、clef、clef-flash 也已上线 MLX,嵌入模型 embeddinggemma-2 同样获得 MLX 支持。
推荐理由:Ollama 在 Apple Silicon 上默认切换到 MLX 运行时,读者可据此了解本地部署的默认行为变化与已支持模型范围。
Unsloth 发布 v0.1.903-beta,在聊天旁加入内置浏览器面板,文件、网页和模型生成的 HTML 都以标签页打开,并支持对页面内容提问。该版本同时支持 Google DeepMind 的多模态嵌入模型 EmbeddingGemma 2,提供 740M 参数版本(纯文本 270M)、100+ 语言和 8K 上下文窗口,代码任务比上一代提升约 14%。
推荐理由:Unsloth 一次更新同时加入内置浏览器、EmbeddingGemma 2 支持与语音克隆页面,可据此判断本地微调工具链的边界扩展。
Ollama 发布 v0.40.0-rc6,在 MLX 推理后端实现 EmbeddingGemma2Model 架构,包含 24 层双向文本编码器、PLE 以及共享的 gemma4 视觉/音频塔,输出采用 mean-pool + L2。该版本的 /api/embed 接口支持通过 input dicts 传入逐项媒体内容。
Google Earth AI 的 Population Dynamics Foundation Model(PDFM)将匿名搜索趋势、人口流动、建成环境密度和环境数据压缩为按月更新的位置嵌入向量,无需任务微调即可直接接入现有流行病学模型。
vLLM 发布 v0.31.0,含 307 位贡献者的 717 个提交,重点优化 DeepSeek-V4.1-Flash:FlashMLA mega attention 搭配 NVFP4 压缩 KV cache 成为 SM100 默认配置。
Claude Code 发布 v2.1.291,修复了 2.1.290 中云会话可能丢失权限提示回答的回归问题,以及 2.1.288 中退出会话时最后几条消息可能丢失的回归问题。该版本自上一版以来包含 7 个提交。
Ollama 发布 v0.40.0-rc5,修复针对近期 MLX 更新的补丁(#18812)。该版本为候选发布版,提交已通过 GitHub 签名验证。
Ollama 发布 v0.40.0-rc4,本次更新包含 MLX 版本升级,并为单元测试添加 scopes 以降低内存占用。该版本为候选发布版(rc),提交已通过 GitHub 验证签名。
Google DeepMind 发布开放权重多模态嵌入模型 EmbeddingGemma 2,可将文本、图像、视频帧和音频映射到统一向量空间,参数量 740M,文本权重最低约 191MB 内存,完整多模态模型在 Google Pixel 11 Pro 上约 567MB。
推荐理由:EmbeddingGemma 2 把文本、图像、视频帧和音频映射到同一向量空间,并给出端侧内存与延迟数据,可据此判断本地多模态检索的落地边界。
Claude Code v2.1.290 发布,为 mod 的 turn.step hook 结果新增 serverToolUses 字段,记录 API 自身发起的工具调用及其 id、名称、输入和起止时间。
NVIDIA Inception 计划中的多家初创公司正用 AI 覆盖乳腺癌筛查、风险评估与治疗规划全流程。iSono Health 的 FDA 认证 ATUSA 可穿戴 3D 超声系统约两分钟完成单侧乳房扫描,灵敏度比手持 2D 超声高 28%;Whiterabbit.ai 的 WRDensity 已用于数十万患者;Ataraxis AI 则用病理切片预测治疗反应与复发风险。
针对扩散 Transformer 长序列生成中稀疏注意力导致质量下降的问题,研究者提出免训练框架 MC-Sparse,通过缓存查询分组、KV 索引与稠密-稀疏注意力残差并在去噪步骤间复用,实现更高保真度。在 Minimax-H3-Base 上取得 1.80 倍去噪加速,3D 资产生成上达 2.32 倍,质量损失可忽略。
DeepSpeed 合并 PR #8497,为连续批处理 rollout 新增可选的 decode front 对齐路径:开启 align_decode_fronts 后按 attention mask 推导有效 prompt 长度、从长到短排序并右对齐 prefill,同时裁剪无效 cache 列,默认仍保持等宽填充布局。
Claude Code v2.1.289 修复了复合 shell 命令嵌套部分的 deny/ask 规则在托管机器上覆盖用户安装 mod 审批的问题,并解决了短代码块含大量未闭合标签或深层嵌套 ${} 替换时终端卡死。