⏶17
dOPSD: 扩散语言模型的策略自蒸馏
发表
由
LIQIIIII 提交
作者: Phuong Tuan Dat, Qi Li, Xinchao Wang
摘要
AI 生成总结
扩散大语言模型在通过后训练增强推理能力方面面临挑战,但一种使用内部去噪轨迹的新型在策略自蒸馏方法提高了数学推理和代码生成性能。扩散大型语言模型(dLLM)通过迭代去噪掩码序列来生成文本,为自回归模型提供了一种并行替代方案,但通过后训练激发强大的推理能力仍然很困难:监督微调是离策略的,并且存在暴露偏差;而强化学习只提供稀疏的序列级奖励,并且在没有可追踪序列似然的情况下很难应用。在线策略自蒸馏(OPSD)提供了一种有前景的替代方案,它使用一个模型同时作为学生和教师,提供密集的、token 级的在线策略监督,但其有效性取决于向教师提供特权信息(PI)——通常是推理时不可用的实例特定真实参考——因此学生最终蒸馏出一个弱的无 PI 共识策略,对 dLLM 推理的改进甚微。我们引入了 dOPSD,它直接从学生自身的去噪轨迹中获取教师的特权,使用该轨迹中后续、更多解码的步骤来评估掩码位置,而不是外部标签,因此教师的优势来自于模型自身的解码过程;在 Dream 和 LLaDA 上,dOPSD 改进了域内数学推理和域外代码生成,优于监督和在线策略基线。
Github仓库:https://github.com/tuandattt/dOPSD