⏶158
通过简单统一的缩放实现金牌级奥数推理
发表
由
Yafu Li 提交
作者: Yafu Li,
Runzhe Zhan,
Haoran Zhang, Shunkai Zhang,
Yizhuo Li, Zhilin Wang, Jiacheng Chen, Futing Wang, Xuyang Hu,
Yuchen Fan, Bangjie Xu, Yucheng Su, Xinmiao Han, Chenxi Li, Haodi Lei, Yufeng Zhao, Zejin Lin, Qianjia Cheng, Tong Zhu, Xiaoye Qu, Ganqu Cui, Peng Ye, Yun Luo, Zhouchen Lin, Yu Qiao, Bowen Zhou, Ning Ding,
Yu Cheng
摘要
AI 生成总结
一种系统化方法通过逆困惑度课程学习、两阶段强化学习和测试时外推,将预训练推理模型转化为严谨的奥数级解题器,在数学和物理竞赛中达到金牌水准。推理模型的最新进展显著推进了长程数学和科学问题的解决,目前已有多个系统在国际数学奥林匹克 (IMO) 和国际物理奥林匹克 (IPhO) 题目上达到了金牌级水平。在本文中,我们介绍了一种简单且统一的方案,用于将经过后训练的推理主干网络转化为严谨的奥赛级求解器。该方案首先在监督微调 (SFT) 中使用反向困惑度课程来注入严谨的证明搜索和自检行为,随后通过一个两阶段强化学习 (RL) 流水线(从具有可验证奖励的 RL 演进到更精细的证明级 RL)来扩展这些行为,最后通过测试时缩放 (test-time scaling) 来提升求解性能。应用该方案,我们在约 34 万条子 8K 令牌轨迹上对一个 30B-A3B 主干进行 SFT,随后进行 200 个 RL 步数的训练。由此产生的模型 SU-01 能够在轨迹超过 100K 令牌的困难问题上支持稳定的推理,同时在包括 IMO 2025/USAMO 2026 和 IPhO 2024/2025 在内的数理奥林匹克竞赛中达到金牌级表现。它还展示了科学推理向数学和物理以外领域的强大泛化能力。
评论
这很有意思,因为这篇论文的重点不在于构建一个全新的模型,而更多地在于通过更好的训练和缩放方法来提高推理能力。
将课程学习、强化学习和长链推理相结合的想法,似乎是帮助该模型在困难的数学和物理问题上达到奥赛级水平的关键。处理超过 100K token 推理路径的能力尤其令人印象深刻,因为许多模型在极长的问题解决过程中难以保持一致性。
我还发现“自我检查”和证明搜索行为非常重要,因为奥赛题目不仅在于得出答案,更在于展示严密的逻辑步骤。
我在 https://8171-web-portals.pk/ 上阅读了一些关于 AI 和推理模型的讨论,人们在那里谈论未来 AI 的进步可能更多地取决于推理质量和训练方法,而不仅仅是增加模型规模。
总的来说,这篇论文展示了结构化的推理训练如何推动模型更接近专家级的科学和数学问题解决能力。
我们已经开源了代码和模型。请查看我们的项目主页和 GitHub 仓库:
https://simplified-reasoning.github.io/SU-01/
https://github.com/Simplified-Reasoning/SU-01