InternVLA-A1.5: 统一理解、潜在预见和行动,实现组合泛化

发表
taesiritaesiri 提交
作者: Haoxiang MaHaoxiang Ma, Junhao Cai, Xiaoxu Xu, Hao Li, Yuyin Yang, Yang Tian, Jiafei Cao, Hongrui Zhu, Zherui Qiu, Zhaxizhuoma, Yuqiang Yang, Jiaqi Peng, Xueyuan Wei, Yangkun Zhu, Jiahao JiangJiahao Jiang, Xing Gao, Hanqing Wang, Feng Yuan, Kailin Li, Xueyue Zhu, Tai Wang, Yan Ding, Jiangmiao Pang, Jia Zeng, Jingjing Zhang, Bowen Zhou, Yao Mu, Chunhua Shen, Weinan Zhang

摘要

AI 生成总结
InternVLA-A1.5 将预训练的视觉语言模型与潜在空间中的未来预测相结合,以实现高效的机器人操作,同时保留语义并支持长时程执行。
机器人操作的统一模型旨在使一个策略同时具备预训练 VLM 的语义先验知识和通过未来预测学习的物理动力学。在实践中,现有设计往往会削弱预训练骨干的语义,遭受异构目标之间的干扰,并在像素空间中从头学习未来预测,从而未能利用预训练视频生成器的动力学先验知识。我们提出了 InternVLA-A1.5,它在原生 VLM 骨干上构建策略,该骨干继续在 VQA 和子任务预测上进行训练,并附加了一个轻量级的统一专家用于连续动作生成。未来预测被重新构想为潜在查询问题,其中一小组可学习的预见 token 在冻结的预训练视频生成模型的监督下,将任务相关的未来浓缩成紧凑的潜在代码,因此策略继承了世界模型动力学先验,而无需学习像素级生成。在推理时,视频分支被丢弃,以保持实时控制。InternVLA-A1.5 在 120 万个机器人片段和 300 万个多模态样本上进行预训练,在所有六个模拟基准测试中取得了最佳整体结果。在现实世界中,保留的语义在未见的指令绑定上提供了最强的组合泛化能力,并且这两种设计共同支持了长视程执行。
查看 arXiv 页面查看 PDF

评论

Haoxiang MaHaoxiang Ma
论文作者

您好,我是这篇论文的作者,您能添加开源代码链接吗? https://github.com/InternRobotics/InternVLA-A-series