Hugging Face Daily Papers·· 2 天前精选AI 评分55
Memento 3:通过反思式规则手册实现基于模型的递归自我改进
Memento 3: Model-Based Recursive Self-Improvement through Reflective Rulebooks
AI 导读
论文提出 Memento 3,让冻结的 LLM 智能体通过外部记忆持续学习显式世界模型:智能体维护一份自然语言规则手册作为持久语义记忆,记录关于环境动态的可修正假设,并将规则手册编译为可执行代码用于预测和规划,通过观察、反思、规则修订、编译与验证的循环,用预测误差同时改进规则手册和代码,更新后的代码仅在 LLM 判断其忠实于规则手册且逐格重放能复现观测到的状态转移时才被接受。
推荐理由
论文给出冻结 LLM 通过外部规则手册持续修正世界模型的方法,并附 ARC-AGI-3 与 Atari Pong 的量化结果。
来源:Hugging Face Daily Papers · huggingface.co