⏶144
Geometry-Guided Reinforcement Learning for Multi-view Consistent 3D Scene Editing 几何引导的强化学习,用于多视角一致的 3D 场景编辑
发表
由
JiYuan Wang 提交
作者:
Jiyuan Wang, Chunyu Lin, Lei Sun, Zhi Cao,
Yuyang Yin,
Lang Nie,
Zhenlong Yuan, Xiangxiang Chu, Yunchao Wei,
Kang Liao, Guosheng Lin
摘要
AI 生成总结
RL3DEdit 利用来自 3D 基础模型的奖励进行强化学习,从而根据 2D 编辑先验实现多视图一致的 3D 编辑。利用 2D 扩散模型的先验进行 3D 编辑已成为一种极具前景的范式。然而,在编辑结果中保持多视图一致性仍然具有挑战性,且由于 3D 一致编辑配对数据的极端匮乏,使得最有效的编辑任务训练策略——监督微调 (SFT) 变得不可行。在本文中,我们观察到虽然生成多视图一致的 3D 内容非常困难,但验证 3D 一致性却是可行的,这自然使强化学习 (RL) 成为一种可行的解决方案。受此启发,我们提出了 RL3DEdit,这是一个由 RL 优化驱动的单次传递框架,其具有源自 3D 基础模型 VGGT 的新型奖励。具体而言,我们利用 VGGT 从海量真实世界数据中学习到的稳健先验,输入编辑后的图像,并将输出的置信度图和姿态估计误差作为奖励信号,通过 RL 有效地将 2D 编辑先验锚定到 3D 一致流形上。大量实验表明,RL3DEdit 实现了稳定的多视图一致性,并在编辑质量和效率方面优于现有最先进的方法。为了促进 3D 编辑的发展,我们将发布代码和模型。
评论
论文作者
论文提交者
感谢您的关注和精辟的评论!您说得对。在我们的实验中,我们确实观察到在某些场景下,VGGT 并没有输出我们所期望的反映 3D 一致性的稳定置信度图。然而,VGGT 从数百万张训练图像中学习到的先验知识仍然异常强大。虽然并不完美,但它们足以推动 3D 编辑取得实质性进展,尤其是考虑到目前 3D 数据的匮乏。
我们的实证实验结果表明,RL 策略可以实现 3D 一致的输出。关于您提到的更复杂的边缘情况,我们认为目前解决这些问题可能还为时过早。目前,3D 编辑模型即使在简单场景中也难以执行复杂的编辑指令。在处理这些极端情况之前,让 3D 编辑领域的基础能力进一步成熟可能更为实际。
谢谢!
> 感谢您的关注和富有洞察力的评论!您说得对。在我们的实验中,我们确实观察到在某些场景下,VGGT 并没有像我们希望的那样输出反映 3D 一致性的稳定置信度图。然而,VGGT 从数百万张训练图像中学到的先验知识依然异常强大。尽管并不完美,但它们足以推动 3D 编辑取得实质性进展,尤其是在当前 3D 数据稀缺的情况下。
>
> 我们的实证实验结果表明,RL 策略可以实现 3D 一致的输出。关于您提到的更复杂的极端情况(corner cases),我们认为目前在这一领域解决这些问题可能还稍微有些早。目前,3D 编辑模型即使在简单场景下也难以执行复杂的编辑指令。在处理这些边缘情况之前,进一步完善 3D 编辑领域的基础能力可能更为实际。
>
> 谢谢!
非常棒!
“虽然生成多视图一致的 3D 内容极具挑战性,但验证 3D 一致性是易于处理的,这自然地将强化学习定位为一种可行的解决方案。”
----RL3DEdit
论文:https://arxiv.org/abs/2603.03143
项目主页:https://amap-ml.github.io/RL3DEdit/
代码:https://github.com/AMAP-ML/RL3DEdit