跳到正文
今天10月9日周五5 条
  1. arXiv cs.SE22

    LLM 能否模拟新手程序员的错误概念?13 个模型在代码追踪任务上的评估

    研究评估了 13 个 LLM 在代码追踪问题上生成、求解、模拟和诊断新手编程错误概念的能力。前沿模型能可靠完成这些任务,但 ≤14B 的小模型在动态执行上表现吃力,代码微调模型在错误概念模拟时会退回正确执行。错误概念诊断在 True/False 格式下显著比开放式生成任务更容易。

10月5日周一
7月28日周二