跳到正文
arXiv cs.SE· Hexuan Deng, Yue Wang, Wenyu Jiang, Cheng Yang, Haolin Yang, Zhaohua Zhang, Chenchen Zhao, Beiduo Chen, Muxi Chen, Sa Zhu, Geyuan Zhu, Jianhuan Zhuo, Qiuyong Xiao, Tianwen Jiang, Jihong Zhang, Xuebo Liu·· 4 小时前AI 评分43

SWE-Journey:面向长周期多轮交互的编程助手更真实评测基准

SWE-Journey: Towards More Realistic Evaluation of Coding Assistants through Long-Horizon, Multi-Turn Interaction

AI 导读

研究者推出 SWE-Journey 基准,用于更真实地评测 Claude Code、Codex 等编程助手。该基准通过弱到强合成流程自动构建长周期编程任务,并从真实交互数据中挖掘四类用户画像、构建用户模拟智能体来复现多轮交互。结果显示,面对软件架构师角色模型平均通过超 75% 的功能测试,而面对非程序员角色时通过率不足 25%。

来源:arXiv cs.SE · arxiv.org