arXiv cs.SE· Xincheng He, Wanli Dong, Zhaoqiang Guo, Yan Liu, Lei Xu·· 4 小时前AI 评分26
SSCBench:评估工具调用型 LLM 智能体故障注入测试的证据有效性
SSCBench: Evaluating the Evidential Validity of Fault-Injection Tests for Tool-Using LLM Agents
AI 导读
针对工具调用型 LLM 智能体的故障注入评测,研究者提出测量协议并构建 SSCBench,在 2 个 τ-bench 环境中对 4 种故障算子和 5 种智能体配置完成 1,191 次故障执行。
来源:arXiv cs.SE · arxiv.org