⏶65
PixWorld: 在像素空间中统一3D场景生成与重建
发表
由
taesiri 提交
作者:
Sensen Gao, Zhaoqing Wang,
Qihang Cao, Dongdong Yu, Changhu Wang, Jia-Wang Bian
摘要
AI 生成总结
PixWorld 提出了一种统一的像素空间扩散方法,用于 3D 重建和生成,通过直接的图像级监督和几何感知特征对齐,克服了潜在空间方法的局限性。3D 重建和生成通常由不同的范式解决:基于像素的回归用于重建,潜在扩散用于生成。最近的工作试图在潜在空间中统一它们,但存在显著的缺点:扩散目标定义在潜在特征而不是底层 3D 表示上,并且两个分支都存在潜在编码引入的信息损失,同时需要预训练的变分自编码器 (VAE) 或表示自编码器 (RAE)。在本文中,我们以统一的像素空间扩散范式重新 формули 了这两个任务,并引入了 PixWorld,这是一个共同解决 3D 重建和生成的单一模型。通过直接在渲染图像上监督扩散,PixWorld 消除了上述限制,并使优化与 3D 场景保真度对齐。除了在 2D 图像级别操作并缺乏 3D 几何感知的图像和感知监督之外,我们进一步引入了几何感知损失,该损失将渲染视图与预训练 3D 基础模型的几何感知特征空间中的真实值对齐,提供 3D 结构监督。PixWorld 始终优于先前的潜在空间生成方法,并与最先进的重建方法相匹配,证明了统一像素空间方法的优越性。