TREK:蒸馏以探索,强化以改进

发表
XYXXYX 提交
作者: Yuanda Xu, Zhengze Zhou, Kayhan Behdin, Jelena Markovic-Voronov, Hejian Sang, Xiaomin Li, Wenhui Zhu, Xinchen Du, Aida Rahmattalabi, Ran He, Sen Na, Zhipeng Wang, Alborz Geramifard

摘要

AI 生成总结
TREK 通过使用蒸馏进行探索而非模仿,扩展了对策略优化的探索支持,提高了在具有挑战性的数学推理和智能体任务上的性能。
群体相对策略优化(GRPO)在当前策略已经采样到有用推理轨迹时是有效的,但当其正确解模式位于学生策略的现行支持范围之外的难题提示时,它就会停滞不前。我们提出了TREK(通过前向KL的教师引导探索),这是一种简单的分阶段过程,它使用蒸馏不是为了模仿,而是为了扩展探索支持。TREK的一个关键优势是其通用性:因为它只消耗经过验证的输出轨迹,所以它可以使用外部黑盒教师、白盒教师,或者在给定额外推理时上下文的情况下使用相同的模型,并且即使在教师内部信息不可用时,它也能有效地识别哪些难题样本最值得整合。TREK首先识别未经辅助的学生通过率很低的提示,查询提案源以生成经过验证的候选解决方案,保留按当前学生可能性排名前r的提案,应用一个短期的前向KL阶段将这些经过验证的模式拉入学生的支持范围,然后返回到标准的现行策略GRPO优化。在数学推理方面,TREK与DeepSeek-V4提案相结合,在AIME 2024和AIME 2025上改进了所有测试规模的Qwen3模型;对于Qwen3-8B,它将AIME 2025从36.9提高到40.3,AIME 2024从47.9提高到51.1(avg@16),而自上下文变体在没有外部教师的情况下达到38.5和49.6。在智能体任务方面,TREK将ALFWorld的成功率从75.8提高到82.8,ScienceWorld的成功率从12.5提高到26.7;值得注意的是,在最困难的任务类型上,TREK在训练早期就取得了高成功率,而未经辅助的GRPO需要更多的优化步骤才能达到相似水平。
查看 arXiv 页面查看 PDF

评论

XYXXYX
论文提交者

探索性蒸馏