跳到正文
Hugging Face Daily Papers·· 7 天前AI 评分38

组合偏好奖励与评分奖励,后训练前沿文生图模型

Post-Training Frontier Text-to-Image Models by Composing Preference and Rubric Rewards

AI 导读

研究者提出一种组合互补奖励信号的后训练方法,用于开放域文生图:偏好奖励基于大规模人类偏好数据以 Bradley-Terry 目标训练,评分奖励评估提示词忠实度并防止奖励攻击。

来源:Hugging Face Daily Papers · huggingface.co