Hugging Face Daily Papers·· 2 天前AI 评分41
Learn2Play Bench:LLM 智能体在陌生环境中从经验学习的效果如何?
Learn2Play Bench: How Well Do LLM Agents Learn from Experience in Unfamiliar Environments?
AI 导读
研究者推出 Learn2Play Bench,用规则新颖或反直觉的文本游戏评测 LLM 智能体的经验学习能力,游戏提供可复现反馈与自动评分,并变换实例测试知识迁移。评测 backbone 模型、自进化方法和 agent harness 后发现:保留完整动作与反馈记录比总结成规则更利于学习;顶尖人类玩家峰值分数高于受测智能体;固定 backbone 时更换 harness 可提升表现并降低推理成本。
来源:Hugging Face Daily Papers · huggingface.co