Geometry-Guided Reinforcement Learning for Multi-view Consistent 3D Scene Editing 几何引导的强化学习,用于多视角一致的 3D 场景编辑

发表
JiYuan WangJiYuan Wang 提交
作者: JiYuan WangJiyuan Wang, Chunyu Lin, Lei Sun, Zhi Cao, yuyangyinYuyang Yin, Lang NieLang Nie, Zhenlong YuanZhenlong Yuan, Xiangxiang Chu, Yunchao Wei, Kang LiaoKang Liao, Guosheng Lin

摘要

AI 生成总结
RL3DEdit 利用来自 3D 基础模型的奖励进行强化学习,从而根据 2D 编辑先验实现多视图一致的 3D 编辑。
利用 2D 扩散模型的先验进行 3D 编辑已成为一种极具前景的范式。然而,在编辑结果中保持多视图一致性仍然具有挑战性,且由于 3D 一致编辑配对数据的极端匮乏,使得最有效的编辑任务训练策略——监督微调 (SFT) 变得不可行。在本文中,我们观察到虽然生成多视图一致的 3D 内容非常困难,但验证 3D 一致性却是可行的,这自然使强化学习 (RL) 成为一种可行的解决方案。受此启发,我们提出了 RL3DEdit,这是一个由 RL 优化驱动的单次传递框架,其具有源自 3D 基础模型 VGGT 的新型奖励。具体而言,我们利用 VGGT 从海量真实世界数据中学习到的稳健先验,输入编辑后的图像,并将输出的置信度图和姿态估计误差作为奖励信号,通过 RL 有效地将 2D 编辑先验锚定到 3D 一致流形上。大量实验表明,RL3DEdit 实现了稳定的多视图一致性,并在编辑质量和效率方面优于现有最先进的方法。为了促进 3D 编辑的发展,我们将发布代码和模型。
查看 arXiv 页面查看 PDF

评论

JiYuan WangJiYuan Wang
论文作者
论文提交者

“虽然生成多视图一致的 3D 内容极具挑战性,但验证 3D 一致性是易于处理的,这自然地将强化学习定位为一种可行的解决方案。”
----RL3DEdit

论文:https://arxiv.org/abs/2603.03143

项目主页:https://amap-ml.github.io/RL3DEdit/

代码:https://github.com/AMAP-ML/RL3DEdit

Alexander EzharjanAlexander Ezharjan

好论文!
但如果我们的 2D 编辑模型现在完全由冻结的 3D 基础模型(如 VGGT)的置信度图来监督,我们难道不是仅仅转移了瓶颈吗?虽然作者指出数据驱动的验证器比传统方法更难被“奖励作弊(reward-hack)”,但我们该如何防止 RL 策略最终利用验证器的盲点呢?

另外,当 3D 验证器本身对分布外(OOD)场景具有固有的几何偏见时,我们的编辑会发生什么?

Alexander EzharjanAlexander Ezharjan

我有点担心一件事:当 VGGT 遇到棘手的、高反射纹理时会发生什么?
如果内部位姿估计器在那里出错,我担心 RL 策略可能会选择走捷径。它会不会为了刷置信度分数而产生对抗性伪影,而不是真正学习到真实的 3D 一致性?

JiYuan WangJiYuan Wang
论文作者
论文提交者

感谢您的关注和精辟的评论!您说得对。在我们的实验中,我们确实观察到在某些场景下,VGGT 并没有输出我们所期望的反映 3D 一致性的稳定置信度图。然而,VGGT 从数百万张训练图像中学习到的先验知识仍然异常强大。虽然并不完美,但它们足以推动 3D 编辑取得实质性进展,尤其是考虑到目前 3D 数据的匮乏。

我们的实证实验结果表明,RL 策略可以实现 3D 一致的输出。关于您提到的更复杂的边缘情况,我们认为目前解决这些问题可能还为时过早。目前,3D 编辑模型即使在简单场景中也难以执行复杂的编辑指令。在处理这些极端情况之前,让 3D 编辑领域的基础能力进一步成熟可能更为实际。

谢谢!

Alexander EzharjanAlexander Ezharjan

> 感谢您的关注和富有洞察力的评论!您说得对。在我们的实验中,我们确实观察到在某些场景下,VGGT 并没有像我们希望的那样输出反映 3D 一致性的稳定置信度图。然而,VGGT 从数百万张训练图像中学到的先验知识依然异常强大。尽管并不完美,但它们足以推动 3D 编辑取得实质性进展,尤其是在当前 3D 数据稀缺的情况下。
>
> 我们的实证实验结果表明,RL 策略可以实现 3D 一致的输出。关于您提到的更复杂的极端情况(corner cases),我们认为目前在这一领域解决这些问题可能还稍微有些早。目前,3D 编辑模型即使在简单场景下也难以执行复杂的编辑指令。在处理这些边缘情况之前,进一步完善 3D 编辑领域的基础能力可能更为实际。
>
> 谢谢!

非常棒!