學術論文
2026年7月
HEALing 熵坍縮:基於混合領域熵動態對齊的少樣本 RLVR 探索增強方法
可驗證獎勵強化學習(RLVR)已被證明能夠有效提升大語言模型的推理能力,但現有方法大多依賴充足的訓練數據。在低資源場景下,RLVR 更容易出現嚴重的“熵坍縮”,從而限製模型探索能力並影響推理性能。
為此,本文提出麵向少樣本 RLVR 的 HEAL(混合領域熵動態對齊) 框架。HEAL 首先引入高價值的通用領域數據,以增強模型探索的多樣性;隨後提出 熵動態對齊(EDA) 機製,通過對齊目標領域與通用領域的軌跡級熵動態,進一步緩解熵坍縮,並幫助模型學習更豐富的探索策略。
多領域實驗表明,HEAL 能夠持續提升少樣本 RLVR 的性能。尤其是在僅使用 32 個目標領域樣本的情況下,其效果即可達到甚至超過使用 1000 個目標領域樣本訓練的全量 RLVR。