arXiv cs.SE· Fabio Orazio Mirto, Luca D'Agati, Giuseppe Tricomi, Stefano Silvestri, Francesco Longo, Antonio Puliafito, Giovanni Merlino·· 4 小时前AI 评分30
超越组件测试:Agentic AI 系统的验证研究综述
Beyond Component Testing: Validating Agentic AI Systems
AI 导读
一项系统映射研究综合 262 篇论文,指出 Agentic AI 系统的验证需从组件测试转向对多步轨迹的上下文验证。研究提出覆盖行为、安全、时序、监管与多智能体五个维度的分类体系,发现文献集中于行为评估(105 篇),时序有效性最薄弱(仅 14 篇)。论文结合医疗、工业运营与智能出行三个案例,提出以有限自主规范、对抗性轨迹生成、运行时监控和可审计证据结构为核心的研究议程。
来源:arXiv cs.SE · arxiv.org