研究:LLM无代码修复多数未真正解决bug
热点事件持续更新
研究:LLM无代码修复多数未真正解决bug
1 篇报道1 个报道来源4 小时前更新
先了解这件事
AI 综述
一项研究提出基于浏览器执行的自动化流水线,用于评估大语言模型生成无代码修复的能力,并测试了12种配置生成的322个修复。结果显示,不同执行器下仅14.6%至49.7%的修复真正解决了bug;作者称最强配置Claude Opus 4.6在Claude Sonnet 5执行下最高解决74.1%。
AI 根据报道生成 · 1 小时前更新
最新进展10月9日 12:00
研究:LLM 生成的无代码修复能否真正解决 bug?基于浏览器执行的自动化验证报道时间线
沿着报道,了解事件的不同侧面。
10月9日
- arXiv cs.SE研究:LLM 生成的无代码修复能否真正解决 bug?基于浏览器执行的自动化验证
一项研究提出基于执行的自动化流水线,在真实浏览器环境中评估 LLM 生成无代码修复的能力,测试了 12 种配置生成的 322 个修复。结果显示,不同执行器下仅 14.6% 至 49.7% 的修复解决了 bug,最强配置 Claude Opus 4.6 在 Claude Sonnet 5 执行下最高解决 74.1%。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。