跳到正文
Hugging Face Daily Papers·· 11 天前AI 评分22

ReSPO:重塑序列策略优化,解决离策略学习中的梯度饥饿问题

ReSPO: Reshaped Sequence Policy Optimization for Gradient Starvation in Off-Policy Learning

AI 导读

针对 RLVR 中复用 rollout 导致的梯度饥饿问题,研究者提出 ReSPO(Reshaped Sequence Policy Optimization),用基于 α-散度变分目标与指数方差控制倾斜的平滑双分支序列级核函数替代 clipping:正分支为欠生成的正面回复保留非零梯度权重,负分支抑制严重过度生成的负面回复。

来源:Hugging Face Daily Papers · huggingface.co