大语言模型的代理推理 (Agentic Reasoning)

发表
Jiaru ZouJiaru Zou 提交
作者: Tianxin WeiTianxin Wei, Ting-Wei LiTing-Wei Li, Zhining Liu, Xuying NingXuying Ning, Ze Yang, Jiaru ZouJiaru Zou, Zhichen Zeng, Ruizhong Qiu, Xiao LinXiao Lin, Dongqi Fu, Zihao LiZihao Li, Mengting AiMengting Ai, Duo ZhouDuo Zhou, Wenxuan Bao, Yunzhe LiYunzhe Li, Gaotang Li, Cheng Qian, Yu Wang, Xiangru Tang, Yin Xiao, Liri Fang, Hui Liu, Xianfeng Tang, Yuji Zhang, Chi Wang, Jiaxuan You, Heng Ji, Hanghang Tong, Jingrui He

摘要

AI 生成总结
代理推理(Agentic reasoning)将大语言模型重新定义为具备规划、行动和学习能力的自主代理,能够通过单智能体及多智能体框架在动态环境中进行持续交互。
推理是推断、问题解决和决策背后的基本认知过程。虽然大语言模型(LLMs)在闭合世界设定中展现出强大的推理能力,但在开放式和动态环境中仍面临挑战。智能体推理(Agentic reasoning)标志着一种范式转变,它将 LLMs 重新定义为能够通过持续交互进行规划、行动和学习的自主智能体。在本综述中,我们从三个互补的维度组织智能体推理。首先,我们通过三个层面来表征环境动态:基础智能体推理,建立核心单智能体能力,包括在稳定环境中的规划、工具使用和搜索;自我演进智能体推理,研究智能体如何通过反馈、记忆和自适应来完善这些能力;以及集体多智能体推理,将智能扩展到涉及协调、知识共享和共同目标的协作场景。在这些层面中,我们将情境推理(通过结构化编排扩展测试时交互)与训练后推理(通过强化学习监督微调优化行为)区分开来。我们进一步回顾了在科学、机器人、医疗、自主研究和数学等现实应用及基准测试中的代表性智能体推理框架。本综述将智能体推理方法合成了一个连接思维与行动的统一路线图,并概述了开放性挑战和未来方向,包括个性化、长周期交互、世界建模、可扩展的多智能体训练以及现实部署的治理。
查看 arXiv 页面查看 PDF

评论

Jiaru ZouJiaru Zou
论文作者
论文提交者

🌐 Awesome-Agentic-Reasoning GitHub 链接:https://github.com/weitianxin/Awesome-Agentic-Reasoning

Tianxin WeiTianxin Wei
论文作者

本综述对代理推理(agentic reasoning)进行了全面且统一的展示 🤖🧠。它探讨了推理如何集成到基于大语言模型(LLM)的代理中,以在不同动态环境下驱动规划 🗺️、搜索 🔍、工具使用 🛠️、记忆 🧠、反馈驱动的适应 🔄 以及多智能体协作 👥。

该领域被系统地划分为三种设定:
• 基础代理:用于规划、搜索和工具使用的推理
• 自进化代理:从反馈和长期记忆中学习
• 协作代理:多智能体系统推理中的协调与沟通

本综述回顾了以下领域的基准测试和实际应用:
🧮 数学发现 | 🎨 氛围编程(vibe coding) | 🔬 科学 | 🤖 机器人 | 🏥 医疗保健 | 🧑‍🔬 自主研究 | 🌐 网页探索

通过对约 800 篇论文的分析,本综述强调了关键的系统设计和训练范式,并概述了未来的公开挑战。

DongqiFuDongqiFu

内容全面,不容错过

vansinvansin

了不起的工作
2601.12538_0_en