Claude Haiku 5.5 在 GitHub Copilot 正式可用
Anthropic 最新的轻量模型 Claude Haiku 5.5 已在 GitHub Copilot 正式可用,面向 subagents、快速编辑和终端任务等高频场景。
推荐理由:读者可以了解 Claude Haiku 5.5 在 GitHub Copilot 中的可用范围与计费方式,以及它在编码任务上的初步表现。
Anthropic 最新的轻量模型 Claude Haiku 5.5 已在 GitHub Copilot 正式可用,面向 subagents、快速编辑和终端任务等高频场景。
推荐理由:读者可以了解 Claude Haiku 5.5 在 GitHub Copilot 中的可用范围与计费方式,以及它在编码任务上的初步表现。
在旧金山举行的 Windows AI and Surface 活动上,NVIDIA 与 Microsoft 宣布为 Windows PC 上的 AI 智能体共同设计软硬件,并公布 RTX Spark 笔记本即日开启预售、10 月 16 日开售,紧凑型台式机 11 月上市。
推荐理由:英伟达与微软把智能体运行所需的系统级容器和本地算力硬件一起端出,读者可据此判断本地智能体落地的软硬件门槛。
GitHub 发布与 Microsoft Applied Sciences 联合微调的 ModernBERT 分类器,把 push protection 扩展到无固定格式的密钥,可在 2 毫秒内评估一批候选密钥,据称能把可拦截的密钥数量提升一倍以上。
推荐理由:GitHub 用九个季度数据说明密钥泄露与人工修复的失衡,并给出把检测前移到 push 环节的模型方案。
GitHub 公布专用于密钥检测的微调模型,可读取上下文代码识别凭据,包括没有固定 token 格式的密码,且不生成代码或文本。该模型已自动升级现有 AI 检测密码告警,AI 推送保护进入私有预览,Copilot CLI 与 Copilot App 的 /security-review 命令也将加入密钥分类器检查。
推荐理由:GitHub 把微调后的密钥检测模型接入告警、推送保护和 Copilot 安全审查,可据此了解各功能的开放范围与计费方式。
微软研究院开源 Agent Lightning v1.0,一个约 3500 行代码的轻量智能体强化学习框架,提出 Harnessed Agentic RL 范式,让部署时使用的同一套 agent harness 直接参与训练,无需在训练框架内重新实现智能体。
推荐理由:微软开源 Agent Lightning v1.0,用约 3500 行代码把真实 harness 直接接入 RL 训练,并给出 6000 样本的编码智能体训练结果。
GitHub Copilot 的本地沙箱功能正式可用,覆盖 GitHub Copilot CLI、GitHub Copilot 应用以及使用 Agent Host 的 VS Code 会话。
推荐理由:官方说明本地沙箱在 CLI、应用与 VS Code 中正式可用,读者可据此了解智能体工作流的权限边界如何落地。
GitHub Copilot CLI 1.0.94-0 起可用 /model 发现本地运行的 Ollama 实例中受支持的模型,与已配置模型和 GitHub Copilot 云端模型并列展示。
Microsoft 合伙人研究经理 Jennifer Neville 在 Microsoft Research Podcast 中讨论评测如何推动 AI 系统突破传统 benchmark 的性能边界,以及模型在超出常规测试时出现的「意外失败」。她结合自身从数学、物理、认知科学到计算机科学的经历,分享与当前 AI 系统协作的实用建议,并强调当结果偏离预期时应仔细审视数据。
GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的开放离线基准,基于 1.039 亿个 GitHub pull request 的分布特征构建,包含来自 187 个开源仓库、19 种语言的 219 个 pull request。
微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,它让智能体在隔离的 MCP 工具会话中运行,只根据最终后端状态和副作用打分,而不是看模型生成的文字。
推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用数据库终态而非模型自述来判定成败,并给出 20 次重复下的可靠性数据。
微软研究院开发了一套端到端机器学习流水线,利用 L1 太阳风观测和 AE、Dst 指数预报,结合纬度、地质电导率与电网数据,为美国本土 66,935 座变电站生成 30-60 分钟前的局地空间天气风险估计。
微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,由跨序列、结构、功能、细胞状态和成像等多模态数据训练的生物世界模型,以及连接模型、科学工具、文献与科研人员的交互式 harness 组成。
推荐理由:微软研究院公开 Quine 的多模态生物世界模型与实验闭环,并给出胰腺癌化合物筛选的湿实验验证结果。
微软亚洲研究院新加坡分院(MSRA – Singapore)作为微软在东南亚的首个研究实验室,成立一年来聚焦下一代 AI 模型与智能体系统、领域专用 AI、AI 原生研究实践及生态与人才培养四大方向。该实验室与新加坡医疗生态伙伴合作推进多模态医疗 AI 和自进化诊断智能体,并联合 EDB 于 2026 年 2 月举办物流与运输 AI 高管圆桌会。
GitHub Copilot 应用中的 canvas(画布扩展)是一种用户与智能体共享的可定制界面,可做成看板、issue 分诊板、发布清单或仪表盘,且双向同步——智能体更新画布,用户也能通过按钮、卡片、筛选器直接修改。
GitHub Copilot 提出用 canvas 替代 chat 作为 AI 主要交互界面,canvas 是运行在 GitHub Copilot app 内的全栈应用,可与 agent 双向通信并调用第三方 API、在本地执行代码。
GitHub Copilot 应用重建了 pull request 视图,以应对超大 diff 与评论带来的渲染压力,实测对象是一个包含 2,200 个文件、超 100 万行改动和 400 多条行内评论的开源 pull request。方案将文档高度拆成确定性的代码几何与动态块几何两部分:代码行高可提前精确计算,评论、草稿和回复框则按块惰性测量,并锚定到文件、行号和侧别而非像素坐标。
微软研究院对移动操作机器人工作负载做了首次系统性测量,发现把物理 AI 推理从机器人端侧 GPU 卸载到边缘或云端 GPU 可提升任务成功率、支持更大模型并延长续航。
推荐理由:微软研究院系统测量了机器人端侧 GPU 推理的瓶颈,并给出可复用的 Kubernetes 卸载工具链,读者可据此判断物理 AI 的部署取舍。
微软研究院在 Nature 发表逆合成模型 RetroChimera,并开源其实现与权重。该模型用学习式重排序整合 Transformer 模型 R-SMILES 2 与 GNN 模型 NeuralLoc 的互补预测,在十项挑战性靶标的多步合成路线评测中成功 9 项,优于 de novo 模型的 5 项、编辑模型的 4 项和 NeuralSym 的 2 项。
微软研究院发布 GigaPath-Flash 和 GigaTIME-Flash,以蒸馏自十亿参数 GigaPath 编码器的 22M 参数 ViT-S 骨干替代原模型,在 PANDA 前列腺分级和 EBRAINS 脑肿瘤分型基准上以约 50 倍更少算力达到原 GigaPath 3% 以内的性能。