⏶8
Mastermind: 用于仓库级漏洞复现的策略驱动学习
发表
由
Mingzhe Du 提交
作者:
Mingzhe Du, Luu Anh Tuan, Tianyi Wu, Renyang Liu, Zhijiang Guo, Dong Huang, See-Kiong Ng
摘要
AI 生成总结
引入了一个名为 Mastermind 的双循环框架,该框架将策略学习与特定任务经验分离,以提高软件工程智能体的漏洞复现能力。仓库级漏洞复现是一项要求很高的软件工程 (SE) 任务:智能体必须检查代码库,推断出到达漏洞路径的输入语法,构建概念验证 (PoC),并验证崩溃在修补后的构建中是否消失。最近的 LLM 智能体在方法正确时通常可以执行这些步骤,但它们仍然会因为选择了错误的策略而失败。本文认为,对于此类 SE 智能体而言,策略而非完整的动作轨迹才是正确的学习单元:它足够紧凑以进行优化,足够具体以指导执行,并且足够稳定以在多次尝试中存储和重用。我们提出了 Mastermind,一个双循环框架,将可迁移的策略学习与任务特定经验分开。一个可训练的规划器通过 SFT 和基于里程碑的 GRPO 学习可重用的漏洞复现策略,而一个经验循环则维护任务局部策略记录以指导后续尝试。规划器独立于执行器进行训练,从而允许策略学习改进多个冻结的执行器,而无需修改其动作生成能力。我们在 CyberGym 上使用 260 个训练任务和 200 个保留评估任务对 Mastermind 进行了评估。以 GPT-5.5 作为冻结执行器,Mastermind 实现了 84.5% 的通过率,优于开卷 PoC 上下文 (60.0%)、八选一采样 (63.0%) 和迭代改进 (77.0%)。同一规划器还将 GPT-5.4 mini 和 GLM~5.1 的性能从 45.0% 和 58.5% 提高到 60.0% 和 71.0%。这些结果表明,学习高层策略是改进仓库级 SE 智能体的有效且可迁移的机制。
代码库级漏洞复现是一项要求很高的软件工程(SE)任务:智能体必须检查代码库,推断出到达易受攻击路径的输入语法,构建概念验证(PoC),并验证在修补后的构建中崩溃是否消失。最近的LLM智能体在方法正确时通常可以执行这些步骤,但它们仍然会因为选择了错误的策略而失败。本文认为,策略而非完整的动作轨迹,是此类SE智能体的正确学习单元:它足够紧凑以进行优化,足够具体以指导执行,并且足够稳定以在多次尝试中存储和重用。我们提出了Mastermind,一个双循环框架,将可转移的策略学习与任务特定的经验分离。一个可训练的规划器通过SFT和基于里程碑的GRPO学习可重用的漏洞复现策略,而一个经验循环则维护任务本地的策略记录,以指导后续尝试。规划器独立于执行器进行训练,允许策略学习在不修改其动作生成能力的情况下改进多个冻结的执行器。我们在CyberGym上使用260个训练任务和200个保留的评估任务来评估Mastermind。以GPT-5.5作为冻结执行器,Mastermind达到了84.5%的通过率,优于开放书籍PoC上下文(60.0%)、Best-of-8采样(63.0%)和迭代改进(77.0%)。同一个规划器还将GPT-5.4 mini和GLM~5.1的通过率从45.0%和58.5%提高到60.0%和71.0%。这些结果表明,学习高层策略是改进代码库级SE智能体的一种有效且可转移的机制。