arXiv cs.SE· Utku Boran Torun, Veli Karakaya, Eray T\"uz\"un·· 4 小时前AI 评分32
研究:LLM 生成的无代码修复能否真正解决 bug?基于浏览器执行的自动化验证
Can LLMs Fix It Without Code? Toward Automated Verification of No-Code Bug Fixes
AI 导读
一项研究提出基于执行的自动化流水线,在真实浏览器环境中评估 LLM 生成无代码修复的能力,测试了 12 种配置生成的 322 个修复。结果显示,不同执行器下仅 14.6% 至 49.7% 的修复解决了 bug,最强配置 Claude Opus 4.6 在 Claude Sonnet 5 执行下最高解决 74.1%。
来源:arXiv cs.SE · arxiv.org