统一的音频智能,不以文本智能为退步

发表
Niels RoggeNiels Rogge 提交
作者: Zhifeng Kong, Sang-gil LeeSang-gil Lee, Jaehyeon Kim, Boxin Wang, Zihan Liu, Sungwon Kim, Yang ChenYang Chen, Arushi Goel, Rajarshi Roy, Wenliang Dai, Zhuolin Yang, Yangyi Chen, Dongfu Jiang, Sreyan Ghosh, Tuomas Rintamaki, Andrew Tao, Jonathan Raiman, Mohammad Shoeybi, Bryan Catanzaro, Wei Ping

摘要

AI 生成总结
提出了一个统一的音频-文本大型语言模型,它通过共享的 Transformer 解码器集成音频和文本处理,在多个音频和语音任务中取得了卓越的性能,同时保持了强大的文本推理能力。
音频智能涉及理解、推理和生成音频及语音。在这项工作中,我们介绍了Nemotron-Labs-Audex-30B-A3B (Audex),一个建立在强大的纯文本MoE LLM Nemotron-Cascade-2-30B-A3B之上的统一音频-文本LLM。Audex采用了一种简单的统一设计,只有一个Transformer解码器:音频输入被编码并投影到文本嵌入空间,而文本令牌和量化的音频输出令牌在生成过程中被统一处理。这种架构实现了强大的音频-文本融合、无缝的多模态生成,并与标准LLM训练和推理基础设施兼容。为了进行训练,我们精心整理了包含157.4B音频令牌和320.5B文本令牌的音频-文本数据集。我们对这些数据集进行了多阶段监督训练,然后是纯文本的Cascade RL和多领域在线策略蒸馏。Audex在音频理解、语音识别与翻译、文本到语音、音频生成和语音到语音生成方面均达到了最先进水平,同时在边际或无退化的情况下,保留了其纯文本LLM骨干模型非常引人注目的推理、对齐、知识、长上下文和智能体能力。我们发布了模型检查点以促进开放研究。
查看 arXiv 页面查看 PDF

评论