自主强化策略优化

发表
KABIKABI 提交
作者: KABIGuanting Dong, Hangyu Mao, Kai Ma, Licheng Bao, Ania ForgeYifei Chen, Zhongyuan Wang, Zhongxia Chen, Jiazhen Du, Huiyang Wang, Fuzheng Zhang, Guorui Zhou, Yutao Zhu, Ji-Rong Wen, Zhicheng Dou

摘要

AI 生成总结
代理强化策略优化 (ARPO) 通过平衡长远能力和工具交互,并使用基于熵的自适应运行和优势归因,增强了大型语言模型的多轮推理能力。
大规模可验证奖励强化学习(RLVR)已证明其在利用大型语言模型(LLM)潜力解决单轮推理任务方面的有效性。在真实的推理场景中,LLM通常可以利用外部工具协助解决任务。然而,当前的RL算法未能充分平衡模型的内在长程推理能力与多轮工具交互的熟练度。为了弥补这一差距,我们提出了Agentic Reinforced Policy Optimization(ARPO),一种专为训练多轮LLM代理而设计的新型智能体强化学习算法。通过初步实验,我们观察到,LLM在与外部工具交互后,往往会表现出高度不确定性的行为,其特征是生成token的熵分布增加。受此观察的启发,ARPO结合了一种基于熵的自适应rollout机制,动态平衡全局轨迹采样和步级采样,从而在工具使用后高不确定性步骤促进探索。通过整合优势归因估计,ARPO使LLM能够内化逐步工具使用交互中的优势差异。我们在计算推理、知识推理和深度搜索领域的13个挑战性基准上进行的实验表明,ARPO优于轨迹级RL算法。值得注意的是,ARPO仅使用现有方法所需工具使用预算的一半,就实现了性能提升,为LLM代理与实时动态环境的对齐提供了一个可扩展的解决方案。我们的代码和数据集已发布在https://github.com/dongguanting/ARPO
查看 arXiv 页面查看 PDF

评论

KABIKABI
论文作者
论文提交者
💡 概述

我们提出Agentic Reinforced Policy Optimization (ARPO),这是一种专为训练多轮基于LLM的智能体而定制的智能体强化学习算法。ARPO的核心原则是鼓励策略模型在高熵工具调用轮次中自适应地进行分支采样,从而高效地对齐步骤级别的工具使用行为。

image.png

🔥 关键见解
  1. 我们首次发现,LLM与外部工具环境交互后会出现高熵波动,这表明工具调用会给模型的推理方向带来显著不确定性。
  2. 基于这种熵探索,ARPO提出了一种基于熵的自适应回溯机制。其核心思想是在高熵工具交互轮次中自适应地执行额外的分支采样,以补充对不确定推理步骤的探索。
  3. 为了适应自适应采样,我们提出了优势归因估计,它为回溯中共享的推理步骤分配相同的优势,为分支推理步骤分配不同的优势,从而使模型能够专注于学习不同分支样本的工具调用行为。
  4. 我们在多轮工具交互场景中,通过13个具有挑战性的基准测试(例如数学推理(AIME24、25等)、知识推理(HotpotQA等)和深度搜索(GAIA、HLE等))验证了ARPO相对于其他RL算法的卓越优势。值得注意的是,Qwen3-14B仅使用1k个RL训练样本,就实现了Pass@5指标:GAIA:61.2%,HLE:24%,Xbench-DS:59%。
  5. 得益于自适应采样,ARPO训练期间的工具调用次数仅为GRPO等样本级算法的一半,且算法复杂度更低,使其高效且具有成本效益。
  6. 我们进一步详细提供了ARPO在多轮交互式智能体训练中的原理的理论证明。

🔧✨ ARPO的所有代码、数据集和模型检查点均完全开源:

Github:https://github.com/dongguanting/ARPO

Datasets & Models:https://huggingface.co/collections/dongguanting/arpo-688229ff8a6143fe5b4ad8ae

AYDIN KULANAYDIN KULAN

https://github.com/tarikkaya/aix
我没那么聪明,但我希望你们能为之努力。

DAEHEEKIMDAEHEEKIM

你好,感谢如此有趣的工作。

我对论文中的符号有一个问题。
在3.1(1)中,H_initial 的维度是 1xk。
这个矩阵是否意味着每个轨迹的熵? 或者我认为 NxK 会更合适,以涵盖 N 个轨迹的初始熵。
期待作者的确认。

此致,
a Kim

KABIKABI
论文作者
论文提交者

嗨!感谢您对我们论文的赞扬。您理解正确;如图4所示,H_initial表示单个轨迹的初始熵矩阵,因此它是1*K。

HH

出色的工作!关于软优势估计,我有一些小问题:
1. 软优势估计(SAE)是否意味着对每条轨迹使用原始的GRPO优势计算,并且这将为共享的token分配“正确”的优势?
2. 在rollout阶段,用于生成轨迹的策略模型是当前的策略模型,在计算重要性比率时被描述为 \piold。 \piref 仅用于计算KL损失以约束更新后的策略模型,也就是我们正在训练的模型。这是笔误还是我理解错了?

感谢您的出色工作!

beiqingbeiqing

绝妙的主意