arXiv cs.SE· Shuangjie Yao, Hao Wang, Koushik Sen, Simin Chen, Baishakhi Ray, Dawn Song·· 2 小时前AI 评分51
TestJack:用评估器演化审计编码基准,约34.4%的通过样本违反任务要求
TestJack: Should you trust the results in coding benchmarks? Agentic Coding Benchmarks Auditing via Evaluator Evolution
AI 导读
研究者提出 TestJack,一个超越固定单元测试的补丁评估框架:针对每个 trial 生成覆盖提示词要求的测试,只保留真实补丁能通过的测试,并重新检查失败样本,使每个确认的失败都有可复现测试支撑。
来源:arXiv cs.SE · arxiv.org