超越组件测试:Agentic AI 系统的验证研究综述
一项系统映射研究综合 262 篇论文,指出 Agentic AI 系统的验证需从组件测试转向对多步轨迹的上下文验证。研究提出覆盖行为、安全、时序、监管与多智能体五个维度的分类体系,发现文献集中于行为评估(105 篇),时序有效性最薄弱(仅 14 篇)。论文结合医疗、工业运营与智能出行三个案例,提出以有限自主规范、对抗性轨迹生成、运行时监控和可审计证据结构为核心的研究议程。
一项系统映射研究综合 262 篇论文,指出 Agentic AI 系统的验证需从组件测试转向对多步轨迹的上下文验证。研究提出覆盖行为、安全、时序、监管与多智能体五个维度的分类体系,发现文献集中于行为评估(105 篇),时序有效性最薄弱(仅 14 篇)。论文结合医疗、工业运营与智能出行三个案例,提出以有限自主规范、对抗性轨迹生成、运行时监控和可审计证据结构为核心的研究议程。
Arbiter 框架结合形式化评估规则与多模型 LLM 扫描,用于检测 LLM 编程智能体系统提示词中的干扰模式。该框架应用于 Claude Code、Codex CLI 和 Gemini CLI 三大编程智能体系统提示词,在无向扫描阶段发现 152 项问题,并在针对单一厂商的有向分析中人工标注出 21 种干扰模式。
针对 Pickle 格式预训练模型的安全审计工具 DITTO 发布,它通过追踪 Pickle 虚拟机状态转移并进行上下文感知语义分析来推断模型意图。对超 1 万个 Hugging Face 仓库的分析显示 9.3% 仍依赖 Pickle;DITTO 实现 100% 扫描覆盖率、0% 漏报率和 0.7% 误报率,F1 达 0.966。
研究者提出 PyCache Trap 攻击,利用 Python 加载器接受的替换字节码缓存,将良性源码与隐藏行为配对,在 100 个技能和 7 款扫描器上实现 94-100% 攻击成功率,且扫描器无法语义识别缓存中的行为。
研究构建了首个带时间戳的 Agent 技能复制网络,基于 GitSkills 中每个仓库的 git 历史,覆盖 GitHub 上 2,193,119 次技能采用。
研究提出一种治理合约机制:模型仅以带分数的观察记录形式输出感知结果,准入策略在预设假阳性上限下将分数映射为 true、false 或 unknown,unknown 即拒绝,再由确定性且经充分性校验的合约做最终裁决。
Google 在 Gemini Enterprise Agent Platform 上为 Agent Anomaly Detection 开启 Private Preview,用推理层审计智能体的推理轨迹、工具调用和执行流程,标记行为异常、可疑意图与策略违规。
推荐理由:原文给出分层检测流程与一个抓取型异常实例,可据此判断智能体行为审计在生产中的落地方式。
Google 发布零信任智能体系列第二部分,将安全校验从代码层移到 Gemini Enterprise Agent Platform 的运行时治理层,用 Model Armor、Semantic Governance Policies 和 Agent Anomaly Detection 三项托管控制拦截构建期检查漏掉的四类攻击。
Google Cloud 的 Gemini Enterprise DevEx 计划通过"冲刺"方式,以无内部凭证的开发者视角实测智能体治理全流程,覆盖身份配置、注册、网关绑定、策略与内容安全、请求验证五个工作流。