⏶15
LLM即验证器:一个通用验证框架
发表
由
taesiri 提交
作者: Jacky Kwok, Shulu Li, Pranav Atreya, Yuejiang Liu, Yixing Jiang, Chelsea Finn, Marco Pavone, Ion Stoica, Azalia Mirhoseini
摘要
AI 生成总结
LLM-as-a-Verifier 引入了一个概率验证框架,该框架可跨多个维度进行扩展,以提高解决方案正确性评估和智能体在各种基准测试中的表现。预训练、后训练和测试时计算的扩展已成为提升 LLM 能力的核心范式。在这项工作中,我们识别出验证(即确定解决方案正确性的能力)作为一个新的扩展轴。为了解锁并展示其有效性,我们引入了 LLM-as-a-Verifier,一个通用验证框架,它为智能体任务提供细粒度反馈,而无需额外训练。与提示 LLM 为候选解决方案生成离散分数的标准 LM 判官不同,LLM-as-a-Verifier 计算评分 token logit 分布的期望值以生成连续分数。这种概率公式使得验证能够沿多个维度扩展:(1) 分数粒度,(2) 重复评估,以及 (3) 标准分解。特别是,我们表明,扩展评分粒度可以更好地分离正负解决方案,从而产生更校准的比较。此外,扩展重复评估和标准分解通过减少方差和复杂性,持续提高验证准确性。我们进一步引入了一种成本效益高的排名算法,用于使用验证器的连续分数从候选方案中选择最佳解决方案。LLM-as-a-Verifier 在 Terminal-Bench V2 (86.5%)、SWE-Bench Verified (78.2%)、RoboRewardBench (87.4%) 和 MedAgentBench (73.3%) 上实现了最先进的性能。除了验证之外,LLM-as-a-Verifier 的细粒度信号还可以作为估算任务进度的代理。我们为 Claude Code 构建了一个扩展,使开发人员能够监控和改进他们自己的智能体系统。最后,我们展示了 LLM-as-a-Verifier 可以为强化学习提供密集反馈,提高 SAC 和 GRPO 在机器人和数学推理基准上的样本效率。