跳到正文
arXiv cs.SE· Batuhan Yeltekin, Daniel Bauer·· 2 小时前AI 评分22

LLM 能否模拟新手程序员的错误概念?13 个模型在代码追踪任务上的评估

Can LLMs Simulate Novice Programmers' Misconceptions?

AI 导读

研究评估了 13 个 LLM 在代码追踪问题上生成、求解、模拟和诊断新手编程错误概念的能力。前沿模型能可靠完成这些任务,但 ≤14B 的小模型在动态执行上表现吃力,代码微调模型在错误概念模拟时会退回正确执行。错误概念诊断在 True/False 格式下显著比开放式生成任务更容易。

来源:arXiv cs.SE · arxiv.org