JetBrains 发布 Mellum2.1:面向编码智能体的快速开源模型
JetBrains 发布 Mellum2.1,这是其 6 月开源的 12B MoE 模型的新版本,架构不变,仍为 2.5B 激活参数、Apache 2.0 许可。
推荐理由:JetBrains 开源编码智能体模型 Mellum2.1,读者可了解其 RL 后训练路线与自托管部署方式。
JetBrains 发布 Mellum2.1,这是其 6 月开源的 12B MoE 模型的新版本,架构不变,仍为 2.5B 激活参数、Apache 2.0 许可。
推荐理由:JetBrains 开源编码智能体模型 Mellum2.1,读者可了解其 RL 后训练路线与自托管部署方式。
作者在 HuggingChat 中开启 ML-intern 模式,用提示词让它完成数据集构建、训练、评测和发布,两天内做出六个模型,总计算花费约 103 美元。
推荐理由:作者用 ML Intern 在两天内从零训练并发布六个模型,给出了提示词写法与逐项算力花费,可迁移到自己的训练流程。
Google 发布 AQuA(Ambient Quality Agent),一个在 Google Cloud 项目内旁路运行的质量智能体,按计划、部署后或按需扫描 Cloud Trace、Cloud Logging 或 BigQuery 中的生产轨迹,经采样、评审、聚类、验证、跟踪五阶段流水线输出可验证的故障洞察。
推荐理由:原文给出 AQuA 的五阶段流水线、成本数据和一次真实多智能体排查案例,可据此判断生产环境智能体质量监控的可行做法。
Google Research 在 NBER 发布一项为期三个月的专利撰写实地实验,将当时未发布的 Google Labs AI 专利写作助手(现属 Gemini Notebook)随机开放给 11 家知识产权律所的 133 名律师,其中三分之二获得早期访问权。
推荐理由:三个月专利撰写实验区分了 AI 带来的即时产出提升与无辅助判断力的变化,为理解 AI 对专业能力的影响提供了实证。
AWS 宣布 Claude Haiku 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线。
推荐理由:AWS 官方给出 Haiku 5.5 的定位、成本变化与 Bedrock 接入方式,可据此判断它在多智能体分层中的分工。
在旧金山举行的 Windows AI and Surface 活动上,NVIDIA 与 Microsoft 宣布为 Windows PC 上的 AI 智能体共同设计软硬件,并公布 RTX Spark 笔记本即日开启预售、10 月 16 日开售,紧凑型台式机 11 月上市。
推荐理由:英伟达与微软把智能体运行所需的系统级容器和本地算力硬件一起端出,读者可据此判断本地智能体落地的软硬件门槛。
微软研究院开源 Agent Lightning v1.0,一个约 3500 行代码的轻量智能体强化学习框架,提出 Harnessed Agentic RL 范式,让部署时使用的同一套 agent harness 直接参与训练,无需在训练框架内重新实现智能体。
推荐理由:微软开源 Agent Lightning v1.0,用约 3500 行代码把真实 harness 直接接入 RL 训练,并给出 6000 样本的编码智能体训练结果。
GitHub Copilot 的本地沙箱功能正式可用,覆盖 GitHub Copilot CLI、GitHub Copilot 应用以及使用 Agent Host 的 VS Code 会话。
推荐理由:官方说明本地沙箱在 CLI、应用与 VS Code 中正式可用,读者可据此了解智能体工作流的权限边界如何落地。
Google 发布实验性游戏平台 Playground,用户通过对话式界面输入提示词即可创建、游玩和分享自定义游戏,无需编程经验。平台基于浏览器,支持手机和笔记本游玩,游戏可设为私密、生成分享链接或发布到 Explore 画廊,部分品类支持排行榜和多人对战。Playground 今日面向美国 18 岁以上用户开放,创建权限按 Google AI 订阅分级,后续将接入 Unity Spark。
推荐理由:Google 官方发布实验性游戏平台 Playground,读者可了解其提示词生成游戏的能力边界与开放范围。
Unsloth 发布 v0.1.903-beta,在聊天旁加入内置浏览器面板,文件、网页和模型生成的 HTML 都以标签页打开,并支持对页面内容提问。该版本同时支持 Google DeepMind 的多模态嵌入模型 EmbeddingGemma 2,提供 740M 参数版本(纯文本 270M)、100+ 语言和 8K 上下文窗口,代码任务比上一代提升约 14%。
推荐理由:Unsloth 一次更新同时加入内置浏览器、EmbeddingGemma 2 支持与语音克隆页面,可据此判断本地微调工具链的边界扩展。
Mistral 发布 Mistral Large 4 公开预览,这是一个 1 万亿参数、520 亿激活参数的稀疏多模态模型,权重将于本月底开放。
推荐理由:Mistral 官方给出 1 万亿参数多模态模型的开放权重时间表与自建欧洲算力背景,可据此判断开源前沿模型的竞争位置。
Cursor 上线 Remote Control,用户可在 Cursor iOS app 中查看并回复运行在自己电脑上的本地智能体。该功能默认对除 Enterprise 组织外的所有用户开启,电脑需保持开机联网,可在桌面设置中开启 Keep this computer awake 防止休眠。
推荐理由:官方说明远程控制本地智能体的开启方式与限制,可据此判断移动端接管本地编码流程的可行性。
微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,它让智能体在隔离的 MCP 工具会话中运行,只根据最终后端状态和副作用打分,而不是看模型生成的文字。
推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用数据库终态而非模型自述来判定成败,并给出 20 次重复下的可靠性数据。
GitHub Copilot 本周为 Pro、Pro+、Max、Business 和 Enterprise 用户上线 Claude Sonnet 5.5,并为 Pro+、Max、Business 和 Enterprise 用户提供 GPT-6.1 Sol。
推荐理由:汇总了 Copilot 本周新增模型、动态工作流与桌面自动化能力,可据此判断智能体工作流的可用边界。
JetBrains 在 IDE 中开放 Air 的 Early Access Program,可作为插件从 JetBrains Marketplace 安装,或直接使用 JetBrains IDE 2026.3 EAP 版本。
推荐理由:JetBrains 官方给出 Air 在 IDE 中的并行会话、云端运行与数据流向说明,可据此判断现有编码工作流会如何变化。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展至开发者、企业和消费者,起步价每百万输入 token 2 美元、输出 token 10 美元。
推荐理由:官方披露了 Argon 在编码、企业知识与网络安全上的基准表现和分阶段开放路径,可据此判断前沿模型的能力边界与获取门槛。
Google Research 发布 AI video co-director,一个构建在 Gemini 和 Veo 之上的多智能体编排框架,用于生成连贯的多镜头长视频。
推荐理由:Google 把长视频生成拆成四个可复用的智能体框架,并给出多镜头一致性的评测基准与量化结果。
GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需指向一个 GitHub 仓库,它就会识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告并改进 harness,最后对每个崩溃做定级并生成漏洞报告。
推荐理由:GitHub Security Lab 把模糊测试的 harness 编写、覆盖率追踪与崩溃定级交给 LLM 智能体,读者可据此判断自动化安全测试的边界。
Cursor 发布 Rollouts 和 Security Review 两个机器人,面向代码交付的最后环节,今日起在 Teams 和 Enterprise 套餐提供。
推荐理由:Cursor 把部署监控与安全审查做成两个 PR 机器人,读者可据此判断代码上线环节的自动化边界。
Zed 团队发布 Delta 公测版,这是一个与智能体协作编码并评审其产出的多人环境,支持 macOS、Linux、Windows 及网页端,移动浏览器也可跟进线程。
推荐理由:Zed 团队公开了用 Delta 线程替代 PR 的协作方式与自用数据,可据此判断智能体时代代码评审的另一种组织形态。