用于密集空间感知的视觉预训练

发表
NanNan 提交
作者: Zelin Fu, Bin Tan, Changjiang Sun, Shaohui Liu, Kecheng Zheng, Yinghao Xu, Xing Zhu, Yujun Shen, NanNan Xue

摘要

AI 生成总结
边界建模通过学习亚像素表示来实现密集空间感知,从而增强深度估计并支持具身 AI 应用。
密集的空间感知对于物理智能至关重要,视觉系统需要从像素观测中恢复结构化、度量和可操作的表示。现代视觉基础模型倾向于优先考虑语义不变性,这往往以牺牲详细的空间理解为代价。在这项工作中,我们通过以边界为中心的视角研究视觉预训练,其动机是边界和形状不连续性为感知几何属性提供了重要线索。具体而言,我们提出了掩码边界建模,这是一种自监督范式,它动态学习亚像素边界表示,并随后利用发现的边界承载 token 作为掩码目标,以促进密集视觉 token 学习。通过扩展此框架,我们开发了 LingBot-Vision,并以 DINOv3 作为强大的基线,展示了其在各种下游视觉任务中的有效性。值得注意的是,LingBot-Vision 推动了深度补全从 LingBot-Depth 1.0 到 LingBot-Depth 2.0 的进展,从而产生了增强的深度估计,这是具身人工智能的关键支柱。我们的研究结果表明,边界建模超越了简单的线段,而是作为学习空间结构化视觉表示的可扩展预训练原则。
查看 arXiv 页面查看 PDF

评论

NanNan
论文作者
论文提交者

一种用于空间感知的新型SSL预训练,带有强大的深度模型 LingBot-Depth 2.0