大规模安全测试LLM智能体:从风险发现到证据驱动的验证

发表
YunHao-FengYunHao-Feng 提交
作者: Yunhao Feng, Ruixiao Lin, Ming Wen, Qinqin He, Yanming Guo, Yifan Ding, Yutao Wu, Jialuo Chen, Zhuoer Xu, Xiaohu Du, Jianan Ma, Zixing Chen, Xingjun Ma, Yunhao Chen, Xinhao Deng

摘要

AI 生成总结
自动化安全测试框架 Vera 采用三阶段流程,通过结构化风险分类、组合案例生成以及基于证据验证的自适应沙盒执行来识别和测试 LLM 智能体中的安全风险。
LLM 智能体越来越多地通过外部工具执行自主操作,这导致了复杂且不断演变的安全风险。然而,现有的安全测试针对的是专家设计的安全违规行为,并且相应的结果通过硬编码规则进行评估,这使得随着智能体的发展,扩展成本很高。为此,我们提出了 Vera,一个端到端自动化安全测试框架,它通过一个三阶段、自我强化的管道,为非确定性智能体实例化了软件工程测试原则。首先,文献驱动的探索持续发现新出现的风险,并将其结构化为安全风险、攻击方法和工具执行环境的分类法。其次,跨分类维度组合生成可执行的安全案例,每个案例都指定一个具体的安全目标、一个程序化构建的初始状态,以及一个基于可观察工件的确定性验证谓词。第三,自适应执行在隔离的沙箱中运行异构智能体,其中一个控制智能体根据运行时观察来指导多轮交互,而基于证据的验证器则根据环境状态和工具调用证据而非模型自报告来判断结果。我们在四个生产智能体框架(OpenClaw、Hermes、Codex、Claude Code)上评估了 Vera,揭示了显著的安全弱点,在多通道攻击下,平均攻击成功率达到 93.9%;我们还发布了 Vera-Bench,包含 1600 个可执行安全案例,涵盖三种执行设置下的 124 个风险类别。这些结果表明,模块化、可执行的测试基础设施对于大规模快速演进的智能体系统的严格和可维护的安全评估至关重要。代码已在 https://github.com/Yunhao-Feng/Vera 公开。
查看 arXiv 页面查看 PDF

评论

YunHao-FengYunHao-Feng
论文提交者

LLM智能体越来越多地通过外部工具执行自主操作,这导致了复杂且不断演变的安全风险。然而,现有的安全测试针对的是专家设计的安全漏洞,其相应的结果由硬编码规则评估,这使得随着智能体的演进而扩展它们变得成本高昂。为此,我们提出了Vera,一个端到端的自动化安全测试框架,通过一个三阶段、自我强化的流水线,为非确定性智能体实例化了软件工程测试原则。首先,文献驱动的探索持续发现并将新兴风险构建成安全风险、攻击方法和工具执行环境的分类体系。其次,跨分类维度的组合生成可执行的安全案例,每个案例都指定了一个具体的安全目标、一个通过编程构建的初始状态,以及一个基于可观测工件的确定性验证谓词。第三,自适应执行在隔离的沙盒中运行异构智能体,其中一个控制智能体根据运行时观察结果引导多轮交互,而基于证据的验证器则根据环境状态和工具调用证据而非模型自报告来判断结果。我们在四个生产智能体框架(OpenClaw、Hermes、Codex、Claude Code)上评估了Vera,揭示了显著的安全弱点,在多通道攻击下,平均攻击成功率达到93.9%;我们还发布了Vera-Bench,包含1600个可执行安全案例,涵盖124个风险类别,涉及三种执行设置。这些结果表明,模块化、可执行的测试基础设施对于大规模、快速演进的智能体系统的严谨和可维护的安全评估至关重要。