RLVR训练中的熵坍缩问题及STEER方法

来源未标注:本文探讨了可验证奖励强化学习(RLVR)训练中的熵坍缩问题,即模型探索空间过早收缩导致训练停滞。文章从token-level熵变出发,分析了RLVR训练中增枝和剪枝两种力量的平衡,并提出了STEER方法通过重权重来稳定token-level熵变,从而在数学推理和代码任务中取得稳定提升。

RLVR训练中的熵坍缩问题及STEER方法 | AI 趋势