3D HAMSTER:通过3D轨迹引导弥合分层视觉语言动作模型中的规划与控制

发表
DongyoonDongyoon 提交
作者: Dongyoon Hwang, Byungkun Lee, Dongjin Kim, Hyojin Jang, Hoiyeong Jin, Jueun Mun, Minho Park, Hojoon Lee, Hyunseung Kim, Jaegul Choo

摘要

AI 生成总结
3D HAMSTER 框架通过集成视觉-语言模型和深度编码,为基于点云的控制策略生成度量精确的 3D 轨迹,从而增强了机器人操作能力。
分层视觉-语言-动作(VLA)模型将高级规划与低级控制解耦,以改善机器人操作中的泛化能力。该范式中的最新工作使用视觉-语言模型(VLM)预测的2D末端执行器轨迹作为下游策略的明确指导。然而,最先进的低级策略在点云上的3D度量空间中操作,向其输入缺乏深度的2D指导会迫使每个航路点被赋予其下方任何场景表面的深度,从而产生几何失真的轨迹。我们提出了3D HAMSTER,一个分层框架,通过让规划器直接输出度量可靠的3D轨迹来弥合这一差距。我们通过专用的深度编码器和密集深度重建目标来增强VLM,以预测3D航路点序列,这些序列直接集成到基于点云的低级策略中。在3D轨迹预测、模拟和真实世界操作中,3D HAMSTER始终优于专有VLM和2D引导基线,在外观变化、未见语言、空间和视觉条件下获得最大增益。项目页面可在https://davian-robotics.github.io/3D_HAMSTER/获取。
查看 arXiv 页面查看 PDF

评论

DongyoonDongyoon
论文提交者

🤖 为什么机器人仍然难以根据其在3D中看到的内容进行操作?

大多数视觉-语言-动作规划器在2D中进行推理——它们预测像素路径点,并直接继承其下方的任何深度信息。计划在图像上看起来是正确的,但它并未以机器人实际需要移动通过的几何形状为基础。

我们的新工作3D HAMSTER正面解决了这个问题:它从单一的RGB-D观测和语言指令中预测出基于度量的3D末端执行器轨迹,从而使规划和控制在几何上端到端地保持一致。

很高兴分享它已被IROS 2026接受 🎉

📄 论文:https://arxiv.org/abs/2606.31329
🌐 项目:https://davian-robotics.github.io/3D_HAMSTER/
💻 代码:https://github.com/DAVIAN-Robotics/3D_HAMSTER
🤗 模型:https://huggingface.co/DAVIAN-Robotics/3D_HAMSTER