⏶7
RoboSemanticBench:诊断 VLA 模型动作预测中的语义落地
发表
由
yubin 提交
作者: Bin Yu, Yao Zhang, Haishan Liu, Shijie Lian, Yuliang Wei, Xiaopeng Lin, Zhaolong Shen, Changti Wu, Ruina Hu, Bailing Wang, Cong Huang, Kai Chen
摘要
AI 生成总结
RoboSemanticBench 指出了视觉-语言-动作(VLA)模型中语义理解与动作预测之间的脱节问题,即机器人虽然可以抓取物体,但无法选择语义上正确的物体目标。视觉-语言-动作(VLA)模型的构建前提是,来自预训练语言或视觉-语言骨干网络的语义理解应该指导机器人的动作预测。然而,机器人微调是以在特定任务动作分布上进行模仿优化的,许多评估可以通过视觉或指令-动作捷径来解决。我们推出了 RoboSemanticBench(RSB),这是一个用于诊断动作预测中语义定位(semantic grounding)的具身智能基准:即后训练的 VLA 模型是否能利用复杂的指令语义来选择并操作正确的物理目标。在每个任务(episode)中,机器人会收到一个多项选择数学题或常识问题,观察候选答案积木,并必须抓取与正确答案相对应的积木。RSB 涵盖了在四选一和十选一测试集下的受控算术、小学数学理解以及常识或事实理解。在代表性的 VLA 模型中,我们发现许多策略学会了抓取候选积木,但在控制了抓取成功率之后,它们选择语义上正确积木的概率接近随机或低于随机,揭示了骨干网络层面的语义能力与动作预测之间持久存在的差距。
评论
论文提交者
