⏶99
在语言模型中,扩展嵌入层效果优于扩展专家模型
发表
由
taesiri 提交
作者: Hong Liu, Jiaqi Zhang, Chao Wang, Xing Hu,
Linkun Lyu, Jiaqi Sun, Xurui Yang, Bo Wang, Fengcun Li, Yulei Qian, Lingtong Si, Yerui Sun, Rumei Li, Peng Pei, Yuchen Xie, Xunliang Cai
摘要
AI 生成总结
在大语言模型中,嵌入缩放(Embedding scaling)相比专家缩放(Expert scaling)提供了更优的稀疏性扩展,能够通过系统优化和投机解码实现高效推理。虽然混合专家 (MoE) 架构已成为大语言模型稀疏扩展的标准,但它们日益面临收益递减和系统级瓶颈。在这项工作中,我们探索了嵌入扩展(Embedding Scaling)作为一个强有力的、正交的稀疏扩展维度。通过全面的分析和实验,我们确定了嵌入扩展在哪些特定机制下能比专家扩展实现更优的帕累托前沿。我们系统地描述了决定这一效能的关键架构因素——从参数预算到与模型宽度和深度的相互作用。此外,通过集成定制的系统优化和推测性解码,我们有效地将这种稀疏性转化为切实的推理加速。在这些见解的指导下,我们推出了 LongCat-Flash-Lite,这是一个拥有 68.5B 参数、激活参数约 3B 且从零开始训练的模型。尽管将超过 30B 的参数分配给了嵌入层,LongCat-Flash-Lite 不仅超越了等效参数的 MoE 基准模型,而且在现有同等规模模型中表现出卓越的竞争力,特别是在智能体和编程领域。
嵌入缩放(Embedding scaling)在系统优化和推测解码的辅助下,表现可以超越稀疏语言模型的混合专家模型(MoE),其中 LongCat-Flash-Lite 展现了极强的竞争力。