MolmoAct2:面向真实世界部署的动作推理模型

发表
DuanDuan 提交
作者: Haoquan FangHaoquan Fang, DuanJiafei Duan, Donovan Clay, Sam WangSam Wang, Shuo LiuShuo Liu, Weikai HuangWeikai Huang, Xiang Fan, Wei-Chuan Tsai, Shirui Chen, Yi Ru Wang, Shanli XingShanli Xing, Jaemin Cho, Jae Sung Park, Ainaz Eftekhar, Peter SushkoPeter Sushko, Karen Farley, Angad Wadhwa, Cole HarrisonCole Harrison, Winson Han, Ying-Chun Lee, Eli VanderBilt, Rose Hendrix, SuveenSuveen Ellawela, Lucas Ngoo, Joyce Chai, Zhongzheng Ren, Ali Farhadi, Dieter Fox, Ranjay Krishna

摘要

AI 生成总结
MolmoAct2 提出了一种用于机器人领域的开放动作推理模型,通过专门的视觉语言模型主干、新数据集、开源权重动作分词器、支持连续动作预测的架构重构以及旨在降低延迟的自适应推理,对先前系统进行了改进。
视觉-语言-动作(VLA)模型旨在为机器人提供单一的通用控制器,但目前的系统在现实部署的关键标准上仍有不足。前沿模型是封闭的,开源权重方案通常绑定昂贵的硬件,推理增强型策略因接地(grounding)而产生高昂延迟,且微调后的成功率仍低于可靠使用的阈值。我们推出了 MolmoAct2,这是一个专为实际部署打造的全开源动作推理模型,在前代基础上进行了五个维度的提升。我们引入了 MolmoER,这是一个专门用于空间和具身推理的 VLM 基座,通过“先专业化后排演”的配方在 330 万样本语料库上训练而成。我们发布了三个涵盖低中成本平台的新数据集,包括 MolmoAct2-BimanualYAM,这是 720 小时的遥操作双臂轨迹,构成迄今为止最大的开源双臂数据集,以及质量过滤后的 Franka (DROID) 和 SO100/101 子集。我们提供了 OpenFAST,这是一个在跨五个具身形态的数百万条轨迹上训练的开源权重、开源数据动作分词器。我们重新设计了架构,通过逐层 KV 缓存调节,将流匹配连续动作专家嫁接到离散 token VLM 上。最后,我们提出了 MolmoThink,这是一种自适应深度推理变体,仅针对时间步之间发生变化的场景区域重新预测深度 token,以极低的延迟保留几何接地。在迄今为止针对开源 VLA 进行的最广泛实证研究中,涵盖 7 个模拟和真实世界基准测试,MolmoAct2 超越了包括 Pi-05 在内的强基准模型,而 MolmoER 在 13 个具身推理基准测试中超越了 GPT-5 和 Gemini Robotics ER-1.5。我们发布了模型权重、训练代码和完整的训练数据。项目页面:https://allenai.org/blog/molmoact2
查看 arXiv 页面查看 PDF

评论

DuanDuan
论文作者
论文提交者

视觉-语言-动作 (VLA) 模型旨在为机器人提供单一的通用控制器,但目前的系统在现实部署的关键标准上仍有差距。前沿模型是封闭的,开源权重的替代方案往往与昂贵的硬件绑定,推理增强型策略在定位时会产生极高的延迟,而微调后的成功率仍低于可靠使用的阈值。我们推出了 MolmoAct2,这是一个为实际部署而构建的全开源动作推理模型,在其前作的基础上从五个维度进行了改进。我们引入了 MolmoER,这是一个专门用于空间和具身推理的 VLM 主干网络,采用“先专业化后排练”的方案在 330 万样本语料库上训练而成。我们发布了三个涵盖低中成本平台的全新数据集,包括 MolmoAct2-BimanualYAM,其中包含 720 小时的遥操作双臂轨迹,是迄今为止最大的开源双臂数据集,此外还包括经过质量过滤的 Franka (DROID) 和 SO100/101 子集。我们提供了 OpenFAST,这是一个开源权重、开源数据的动作分词器 (tokenizer),在跨五种具身形式的数百万条轨迹上训练而成。我们重新设计了架构,通过逐层 KV 缓存调节,将流匹配连续动作专家嫁接到离散 token VLM 上。最后,我们提出了 MolmoThink,这是一种自适应深度推理变体,仅针对时间步之间发生变化的场景区域重新预测深度 token,在仅消耗先前一小部分延迟的情况下保留了几何定位能力。在迄今为止对开源 VLA 进行的最广泛的实证研究中(涵盖 7 个模拟和真实世界基准测试),MolmoAct2 优于包括 Pi-05 在内的强基线模型,而 MolmoER 在 13 个具身推理基准测试中超越了 GPT-5 和 Gemini Robotics ER-1.5。我们公开发布了模型权重、训练代码和完整的训练数据。

Sergey KolyubinSergey Kolyubin

是否会有正式的项目页面和 GitHub 项目?目前两者都是空的。

DuanDuan
论文作者
论文提交者

我们将在太平洋标准时间(PST)上午 8 点发布所有内容。敬请关注。