⏶153
自主强化策略优化
发表
由
KABI 提交
作者:
Guanting Dong, Hangyu Mao, Kai Ma, Licheng Bao,
Yifei Chen, Zhongyuan Wang, Zhongxia Chen, Jiazhen Du, Huiyang Wang, Fuzheng Zhang, Guorui Zhou, Yutao Zhu, Ji-Rong Wen, Zhicheng Dou
摘要
AI 生成总结
代理强化策略优化 (ARPO) 通过平衡长远能力和工具交互,并使用基于熵的自适应运行和优势归因,增强了大型语言模型的多轮推理能力。大规模可验证奖励强化学习(RLVR)已证明其在利用大型语言模型(LLM)潜力解决单轮推理任务方面的有效性。在真实的推理场景中,LLM通常可以利用外部工具协助解决任务。然而,当前的RL算法未能充分平衡模型的内在长程推理能力与多轮工具交互的熟练度。为了弥补这一差距,我们提出了Agentic Reinforced Policy Optimization(ARPO),一种专为训练多轮LLM代理而设计的新型智能体强化学习算法。通过初步实验,我们观察到,LLM在与外部工具交互后,往往会表现出高度不确定性的行为,其特征是生成token的熵分布增加。受此观察的启发,ARPO结合了一种基于熵的自适应rollout机制,动态平衡全局轨迹采样和步级采样,从而在工具使用后高不确定性步骤促进探索。通过整合优势归因估计,ARPO使LLM能够内化逐步工具使用交互中的优势差异。我们在计算推理、知识推理和深度搜索领域的13个挑战性基准上进行的实验表明,ARPO优于轨迹级RL算法。值得注意的是,ARPO仅使用现有方法所需工具使用预算的一半,就实现了性能提升,为LLM代理与实时动态环境的对齐提供了一个可扩展的解决方案。我们的代码和数据集已发布在https://github.com/dongguanting/ARPO
我们提出Agentic Reinforced Policy Optimization (ARPO),这是一种专为训练多轮基于LLM的智能体而定制的智能体强化学习算法。ARPO的核心原则是鼓励策略模型在高熵工具调用轮次中自适应地进行分支采样,从而高效地对齐步骤级别的工具使用行为。
🔧✨ ARPO的所有代码、数据集和模型检查点均完全开源:
Github:https://github.com/dongguanting/ARPO
Datasets & Models:https://huggingface.co/collections/dongguanting/arpo-688229ff8a6143fe5b4ad8ae