三思而后行:将树搜索蒸馏到冻结VLA模型的动作评估中

发表
Zican HuZican Hu 提交
作者: Xinyi Xie, Zican HuZican Hu, Zhanyu Liu, YichengDongYicheng Dong, Wenhao Wu, Zhenhong Sun, Haoran Li, Chunlin Chen, Zhi Wang, Pichao Wang

摘要

AI 生成总结
引入了一个名为 SVA 的框架,它通过将动作生成与后果评估解耦来增强视觉-语言-动作模型,从而提高泛化能力和任务成功率,同时降低计算成本。
视觉-语言-动作(VLA)模型通过大规模预训练获得广泛的具身能力,但其泛化能力远比LLM和VLM脆弱。普遍的补救措施,即通过监督微调强化学习进行后训练,虽然提高了特定任务的性能,但却缩小了预训练所赋予的通用能力。我们发现一个关键瓶颈:VLA的失败不仅源于动作生成,也源于动作评估。一项诊断性的pass@k研究证实,冻结的VLA在其输出分布中已经包含了合格的行为,总体成功率从pass@1的33%上升到pass@32的92%。受此启发,我们提出了SVA(搜索、评估和行动),一个简单的框架,为冻结的VLA策略配备长期后果意识。SVA首先在模拟中使用蒙特卡洛树搜索,充分探索VLA的输出分布并收集标有经验回报的多样化轨迹;然后将这些知识蒸馏到一个轻量级Q值模型中,该模型预测候选动作的预期后果;在部署时,冻结的VLA提出多个候选动作,评估器选择具有最高不确定性正则化Q值的动作,无需访问模拟器。通过将动作提议与后果评估解耦,SVA在大幅提高任务成功率的同时,保留了VLA骨干模型的泛化能力。在具身基准上的实验表明,SVA持续改善了未见任务的泛化能力,并展现出强大的测试时扩展行为。引人注目的是,SVA使一个9B的VLA以27%的更低推理延迟超越了一个27B的VLA 7个点,这表明扩展测试时评估比扩展模型大小更具成本效益。
查看 arXiv 页面查看 PDF

评论

Zican HuZican Hu
论文作者
论文提交者

我们发现了一个关键瓶颈:VLA失败不仅源于动作生成,还源于动作评估。一项诊断性pass@k研究证实,冻结的VLA在其输出分布中已经包含有能力的动作,总体成功率从pass@1的33%上升到pass@32。受此启发,我们提出了SVA(搜索、评估和行动),一个简单的框架,为冻结的VLA策略配备了对长期后果的意识。