Nemotron-Labs-Diffusion:一种统一自回归、扩散和自推测解码的三模式语言模型

发表
taesiritaesiri 提交
作者: Yonggan Fu, Lexington Whalen, Abhinav Garg, Chengyue Wu, Maksim Khadkevich, Nicolai Oswald, Enze Xie, Daniel Egert, Sharath Turuvekere Sreenivas, Shizhe Diao, Chenhan Yu, Ye Yu, Weijia Chen, Sajad Norouzi, Jingyu Liu, Shiyi Lan, Ligeng Zhu, Jin Wang, Jindong Jiang, Morteza Mardani, Mehran Maghoumi, Song Han, Ante Jukić, Nima Tajbakhsh, Jan Kautz, Pavlo Molchanov

摘要

AI 生成总结
Nemotron-Labs-Diffusion 是一种三模态语言模型,它结合了自回归、扩散和自我推测解码,与现有模型相比,实现了卓越的吞吐量和效率。
我们引入了Nemotron-Labs-Diffusion,这是一种三模式语言模型(LM),它在单一架构中统一了自回归(AR)、扩散和自推测解码。Nemotron-Labs-Diffusion通过联合AR-扩散目标进行训练,可以切换模式以在不同的部署设置和并发级别下保持高吞吐量。我们的研究表明:(1)AR和扩散目标是互补的:扩散改进了前瞻规划,而AR提供了从左到右的语言先验。(2)在自推测模式下,扩散生成草稿,而AR进行验证,在接受率和真实设备效率方面均优于多令牌预测(MTP)方法。(3)光速分析进一步展示了扩散的长期潜力,在最佳采样器下,每次前向传递的令牌数比自推测多出76.5%。扩展到3B、8B和14B参数,我们的Nemotron-Labs-Diffusion系列,包括基础模型、指令模型和视觉语言模型,在准确性和速度方面始终优于最先进的开源AR和扩散LM。例如,Nemotron-Labs-Diffusion-8B每次前向解码的令牌数是Qwen3-8B的6倍,同时保持可比的准确率,这意味着在GB200 GPU上使用SGLang在SPEED-Bench上的吞吐量高出4倍。
查看 arXiv 页面查看 PDF