在执行点应用安全设计:受治理的安全需求如何影响 AI 生成代码的安全性
研究将来自 SbD-ToE 知识库的安全需求通过 MCP server 在执行点提供给代码生成器,在 DualGauge 的 59 个 Python 任务上,通过全部安全测试的任务占比从 44.1% 升至 78.0%。
研究将来自 SbD-ToE 知识库的安全需求通过 MCP server 在执行点提供给代码生成器,在 DualGauge 的 59 个 Python 任务上,通过全部安全测试的任务占比从 44.1% 升至 78.0%。
研究者提出 CABRA 编程能力评估基准,以调用图变换从零构建任务,并按函数遍历、搜索、运行时解析、指令遵循四个维度用任务规模参数调节难度。
研究者提出 TestJack,一个超越固定单元测试的补丁评估框架:针对每个 trial 生成覆盖提示词要求的测试,只保留真实补丁能通过的测试,并重新检查失败样本,使每个确认的失败都有可复现测试支撑。
研究基于 SESR-Eval 基准及新构建的 SESR-Eval-Mini 数据集,评估了八款新 LLM 在软件工程系统综述筛选任务上的表现,平均 MCC 仅从旧模型的 0.347 微升至 0.365。
研究团队构建了统一数据集与评估框架,用于整体评估 LLM 形式化规范生成(SpecGen),数据集包含 350 个 Lean 任务,其中 189 个来自 VERINA、161 个来自 CLEVER,覆盖形式有效性、参考相似性与等价性、行为充分性。
Agent4RE 是一个自精炼多智能体需求工程(RE)系统,通过编排专用智能体并引入两个迭代改进循环,实现从需求获取到生成的端到端流程。团队同时构建了基于真实人工需求规格的 RE-E2E 数据集,并提出加入自主自精炼或结构化人工反馈的两个增强版本。
研究评估了 13 个 LLM 在代码追踪问题上生成、求解、模拟和诊断新手编程错误概念的能力。前沿模型能可靠完成这些任务,但 ≤14B 的小模型在动态执行上表现吃力,代码微调模型在错误概念模拟时会退回正确执行。错误概念诊断在 True/False 格式下显著比开放式生成任务更容易。
星动纪元自研世界动作模型VPP2登顶RoboDojo仿真榜单,综合平均成功率32.26%、平均得分39.26分,两项指标均列第一,领先GPT-6-Astra的22.48%和28.97分。
MirroS 团队发布 AgentGarten,把可执行代码环境与实时神经渲染器连接,代码定义物理规则、模型生成视觉反馈,以超过 30 fps 的吞吐让智能体持续交互。
OpenAI 面向所有 ChatGPT 用户推出 GPT-6,并带来名为 Intelligent UI 的新功能,模型以图形、按钮、图表和表单等交互界面呈现答案,而非纯文本。
推荐理由:GPT-6 把 ChatGPT 输出从纯文本改为交互界面,并给出等待时间与内部测试对比,可据此判断交互形态的变化。
JetBrains 发布 Mellum2.1,这是其 6 月开源的 12B MoE 模型的新版本,架构不变,仍为 2.5B 激活参数、Apache 2.0 许可。
推荐理由:JetBrains 开源编码智能体模型 Mellum2.1,读者可了解其 RL 后训练路线与自托管部署方式。
Anthropic 发布 Claude Haiku 5.5,这是其最快、最便宜的小模型,平均成本比 Haiku 4.5 低约 75%,提示词不超过 10 万 token 的请求价格最高下降 90%,超过 10 万 token 的请求价格则是前者的五倍。
推荐理由:Anthropic 发布 Haiku 5.5 并大幅降价,读者可据此判断小模型在成本敏感任务中的定位与取舍。
Anthropic 发布 Claude Haiku 5.5,这是 Haiku 系列约一年来的首次更新,定价与 OpenAI 的 GPT-6 Luna 持平,官方称其平均运行成本比 Haiku 4.5 低约 75%。
推荐理由:汇总了 Haiku 5.5 的定价、第三方评测与 token 消耗数据,可据此判断小模型在智能体工作流中的成本取舍。
Anthropic 发布快速低价模型 Claude Haiku 5.5,定价与 OpenAI 上月发布的 GPT-6 Luna 完全一致,为 $0.10/$0.50 每百万 token,超过 100,000 token 后涨价 5 倍至 $0.50/$2.50。
Google Research 在 NBER 发布一项为期三个月的专利撰写实地实验,将当时未发布的 Google Labs AI 专利写作助手(现属 Gemini Notebook)随机开放给 11 家知识产权律所的 133 名律师,其中三分之二获得早期访问权。
推荐理由:三个月专利撰写实验区分了 AI 带来的即时产出提升与无辅助判断力的变化,为理解 AI 对专业能力的影响提供了实证。
OmniCapBench 将音视频描述评估重构为深度结构化诊断框架,把预测目标从自由文本转为实体引用、视觉镜头和音频事件三类原子化可验证评估单元,并基于 786 段密集标注视频进行确定性约束检查与局部 LLM 语义比较。评测前沿 MLLM 显示其局部感知较强,但长时程音视频推理薄弱,尤其存在身份漂移与跨模态错位问题。
研究提出用认知谦逊(EH)评估 LLM 智能体在知识冲突下的表现,通过 Identify、Solve、Escalate(ISE)三个轨迹级行为维度,在受控冲突与多步执行中的自然冲突两种设定下评测四个智能体。结果显示更高任务准确率并不必然对应更强的认知谦逊:部分高准确率配置能识别冲突,却不在错误答案中传达未解决的不确定性。轨迹分析还发现智能体常在执行早期检测到冲突,却在后续步骤中未能维持或解决。
研究者提出 BrickBench,一个面向智能体文本条件 LEGO 套装设计的基准,要求智能体从离散零件库中选件并同时推理局部与全局约束,产出满足语义与设计标准且可实际拼装的方案。配套环境 BrickAgent 让编程智能体构建、检查并验证设计,评测覆盖三种规模与零件可用性设置,从有效性、对齐度和设计三方面打分。结果显示领先智能体基本满足可验证的物理与语义要求,但仍不及人类设计。
研究者提出 Code-Only-as-Policy(COAP),用代码从相机图像和本体感知中测量并跟踪机器人、环境与任务状态,所有决策均由代码完成,测试时无需 VLM 或 VLA 参与。
AWS 宣布 Claude Haiku 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线。
推荐理由:AWS 官方给出 Haiku 5.5 的定位、成本变化与 Bedrock 接入方式,可据此判断它在多智能体分层中的分工。
Liquid AI 发布 d1 决策模型家族的两款开源权重模型 d1-3B 和 d1-omni-600M(实验性)。
推荐理由:Liquid AI 开源两款决策模型,给出端侧延迟与七项基准对比,可判断小模型做结构化决策的可行性。
Mistral 表示其新模型 Le Chonk 能够与顶级闭源模型相抗衡,同时保持开放权重。
阿布扎比技术创新研究院(TII)发布 Falcon-ASR,一款 1.6B 参数的语音识别模型,重点支持阿联酋方言,同时覆盖英语、法语、西班牙语和葡萄牙语。在六个阿拉伯语测试集上平均 WER 为 20.92%,优于所用榜单快照中 23.17% 的最佳公开结果;内部阿联酋方言评测 WER 22.73%、CER 10.19%,比次优的 Qwen3-Omni 低 4.07 个百分点。
英伟达团队基于 Nemotron 3,用监督微调、强化学习和反馈驱动的推理流程,在 IOI 2026 和 IMO 2026 两项竞赛中均达到金牌水平。
推荐理由:原文公开了从 Nemotron 3 微调到 IOI、IMO 金牌级成绩的完整配方与数据集,可据此复现领域专家模型的训练与推理流程。
OpenAI 宣布 GPT-6 正在 ChatGPT 中面向全球上线,并同步引入 Intelligent UI。官方称新版本响应更快,提供可视化内容和可直接探索、使用的交互体验。
推荐理由:OpenAI 官方公布 GPT-6 在 ChatGPT 全球上线,并同步引入 Intelligent UI,读者可据此了解模型与交互形态的同步变化。
Google DeepMind 发布 EmbeddingGemma 2,一个基于 Gemma 4 架构、Apache 2.0 许可的开源多模态嵌入模型,可把文本、图像、音频和视频映射到统一嵌入空间。
推荐理由:官方给出 740M 参数、模块化编码器与端侧内存占用,可据此判断本地多模态检索的落地门槛。
Google Earth AI 的 Population Dynamics Foundation Model(PDFM)将匿名搜索趋势、人口流动、建成环境密度和环境数据压缩为按月更新的位置嵌入向量,无需任务微调即可直接接入现有流行病学模型。
Mistral 发布 Mistral Large 4 公开预览,这是一个 1 万亿参数、520 亿激活参数的稀疏多模态模型,权重将于本月底开放。
推荐理由:Mistral 官方给出 1 万亿参数多模态模型的开放权重时间表与自建欧洲算力背景,可据此判断开源前沿模型的竞争位置。
Reflection 发布 Beam,一个面向编码、智能体与科研的纯文本 MoE 模型,总参数 501B、激活 23B,从零训练,完整权重将以 Apache 2.0 于本月放出。
Google 发布基于 Gemma 4 的 EmbeddingGemma 2,这是一个 Apache 2.0 许可的 sub-1B 开源嵌入模型,可将文本、代码、图像、视频和音频映射到统一的 768 维空间。
推荐理由:EmbeddingGemma 2 的模块化编码器与 MRL 截断方案,为多模态 RAG 的显存与存储取舍提供了可量化的参考。
Google DeepMind 发布开放权重多模态嵌入模型 EmbeddingGemma 2,可将文本、图像、视频帧和音频映射到统一向量空间,参数量 740M,文本权重最低约 191MB 内存,完整多模态模型在 Google Pixel 11 Pro 上约 567MB。
推荐理由:EmbeddingGemma 2 把文本、图像、视频帧和音频映射到同一向量空间,并给出端侧内存与延迟数据,可据此判断本地多模态检索的落地边界。
Google 发布《智能体隐私与安全中的开放与新兴问题:上下文视角》研讨会报告,汇集 50 多位学界与业界专家,于 2025 年底在纽约 Google CAPS 研讨会上完成。报告指出智能体因非结构化接口与输入歧义、概率性控制流、自主性与委派三大特性带来新挑战,主张以 Contextual Integrity 理论为基础,构建上下文策略引擎,在系统沙箱、模型推理和用户控制多层协同防护。
GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的开放离线基准,基于 1.039 亿个 GitHub pull request 的分布特征构建,包含来自 187 个开源仓库、19 种语言的 219 个 pull request。
MIT Technology Review 对 300 名数据与 AI 高管的调研显示,企业平均仅约 34% 的智能体 AI 项目能进入生产环境,知识、上下文缺失与遗留数据系统、安全隐私顾虑是主要失败点。
针对扩散 Transformer 长序列生成中稀疏注意力导致质量下降的问题,研究者提出免训练框架 MC-Sparse,通过缓存查询分组、KV 索引与稠密-稀疏注意力残差并在去噪步骤间复用,实现更高保真度。在 Minimax-H3-Base 上取得 1.80 倍去噪加速,3D 资产生成上达 2.32 倍,质量损失可忽略。
微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,它让智能体在隔离的 MCP 工具会话中运行,只根据最终后端状态和副作用打分,而不是看模型生成的文字。
推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用数据库终态而非模型自述来判定成败,并给出 20 次重复下的可靠性数据。
一项受控研究用双人石头剪刀布和单人随机 n-gram 续写任务,测试 LLM 能否识别潜在策略、遵循简单马尔可夫规则并维持高阶条件依赖。结果显示更长的上下文并不能提升识别能力,正确识别也不保证忠实模拟,高阶依赖会显著削弱规则恢复,表面行为保真可能掩盖错误的生成机制。
Ai2 开源 AstaBrief 8B,一个把研究问题和检索到的文献片段转成带引用报告的小模型,基于 Qwen3-8B 训练,现已作为 Asta 的 Fast 模式上线,并同步开放模型权重和训练数据。
推荐理由:原文给出了从 Qwen3-8B 出发的 SFT 加 DPO 训练配方与数据过滤经验,可迁移到其他垂直领域小模型。
Google 发布新一代联邦学习系统,用可信执行环境(TEE)为数据匿名化提供可验证、可审计的保证,Gboard 已采用该系统上线英语和日语下一词预测模型。新系统把客户端梯度计算移到服务端,训练时间瓶颈从设备可用性转为 TEE 资源,此前每个模型训练需 1-2 个月。
推荐理由:Google 公布基于 TEE 的新一代联邦学习系统设计,并给出 Gboard 已上线的实际部署效果。
ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例与更强教师的成功示范,自动生成并验证新的可执行训练任务,并随模型进步动态调整课程。该流程以 EnterpriseOps Gym 数据集为例演示,生成的任务需满足可行性、真实性与难度三项要求,验证器则需保证一致性、可靠性与完整性。