学术论文
2026年7月
HEALing 熵坍缩:基于混合领域熵动态对齐的少样本 RLVR 探索增强方法
可验证奖励强化学习(RLVR)已被证明能够有效提升大语言模型的推理能力,但现有方法大多依赖充足的训练数据。在低资源场景下,RLVR 更容易出现严重的“熵坍缩”,从而限制模型探索能力并影响推理性能。
为此,本文提出面向少样本 RLVR 的 HEAL(混合领域熵动态对齐) 框架。HEAL 首先引入高价值的通用领域数据,以增强模型探索的多样性;随后提出 熵动态对齐(EDA) 机制,通过对齐目标领域与通用领域的轨迹级熵动态,进一步缓解熵坍缩,并帮助模型学习更丰富的探索策略。
多领域实验表明,HEAL 能够持续提升少样本 RLVR 的性能。尤其是在仅使用 32 个目标领域样本的情况下,其效果即可达到甚至超过使用 1000 个目标领域样本训练的全量 RLVR。