⏶76
OmniOpt:现代优化器的分类学、几何学和基准测试
发表
由
Cheng Tan 提交
作者:
Siyuan Li, Jiabao Pan, Yumou Liu, Zhuoli Ouyang,
Xin Jin, Xinglong Xu, Jingxuan Wei, Shengye Pang, Jintao Che, Xuanhe Zhou, Conghui He, Cheng Tan
摘要
AI 生成总结
OmniOpt 提出了一个用于大规模模型训练中优化器选择的统一框架,通过结合元管道转换、范数约束线性最小化预言机以及跨领域基准测试,系统地分析优化器家族及其在不同训练目标和模型规模下的权衡。大规模模型训练的优化器选择已成为一个系统级设计决策,受计算、内存、调优预算和任务多样性的共同约束,然而一百多种方法的格局仍然分散。因此,我们提出了OmniOpt,一个为研究社区提供统一的优化器调查和基准指南。OmniOpt基于四个耦合组件。首先,我们将每个优化器更新视为通过五阶段元流水线的结构化变换,并表明大多数方法只涉及其中一两个阶段。其次,我们使用范数约束线性最小化预言机(LMOs)来统一不同的优化器。第三,这两个视图构成了双维度分类法,一个维度将每种方法分配给一个机制家族,另一个维度记录其旨在改进的可测量训练目标。第四,也是本文的核心,我们在一个统一的跨领域基准中实例化了完整的分类法,该基准涵盖了从语言模型预训练到图像分类的代表性优化器、模型规模和训练机制,系统地分析了每个方法家族在多个效果目标上的表现,并阐述了它们的权衡。因此,OmniOpt为研究社区提供了一个在明确机制和目标假设下选择优化器的操作坐标系,并为优化器社区的未来发展指明了方向。

大规模模型训练的优化器选择受计算、内存、调优预算和任务多样性的限制,然而一百多种方法的领域仍然支离破碎。我们推出了OmniOpt,一个为研究社区提供统一调查和基准测试指南的工具。OmniOpt包含四个相互关联的组件。首先,我们将每个优化器更新建模为五阶段元流水线,并表明大多数方法只涉及其中一到两个阶段。其次,我们使用范数约束线性最小化预言机(LMOs)来统一不同的优化器。第三,这两个视角奠定了双维度分类法:一个轴将每种方法分配给一个机制家族,另一个轴记录其针对的可测量训练目标。第四,我们在一个全面的跨领域基准测试中实例化了这一分类法,该基准测试涵盖了从语言模型预训练到图像分类的代表性优化器、模型规模和训练方案。我们系统地分析了每个方法家族在多个效果目标上的表现,并详细阐述了它们的权衡。因此,OmniOpt为社区提供了一个在明确机制和目标假设下选择优化器的操作坐标系,并为未来的优化器开发指明了清晰的方向。