⏶15
LuxDiT:基于视频扩散 Transformer 的光照估计
发表
由
Niels Rogge 提交
作者: Ruofan Liang, Kai He, Zan Gojcic, Igor Gilitschenski, Sanja Fidler, Nandita Vijaykumar, Zian Wang
摘要
AI 生成总结
LuxDiT 是一种通过低秩适应进行微调的视频扩散 Transformer,它能从视觉输入生成准确的 HDR 环境地图,性能优于现有方法。从单张图像或视频中估算场景光照,在计算机视觉和图形学领域仍然是一个长期存在的挑战。基于学习的方法受到真实高动态范围(HDR)环境贴图稀缺的限制,这类贴图的采集成本高昂且多样性有限。尽管近期的生成模型在图像合成方面提供了强大的先验知识,但光照估算仍然很困难,因为它依赖于间接的视觉线索,需要推断全局(非局部)上下文,并且需要恢复高动态范围的输出。我们提出了 LuxDiT,一种新颖的数据驱动方法,通过微调视频扩散 Transformer,以视觉输入为条件生成 HDR 环境贴图。我们的模型在具有多样化光照条件的大型合成数据集上进行训练,学会了从间接视觉线索推断光照,并能有效地泛化到真实场景。为了改善输入与预测环境贴图之间的语义对齐,我们引入了一种使用收集到的 HDR 全景图数据集的低秩适配微调策略。我们的方法能够生成具有逼真角高频细节的准确光照预测,在定量和定性评估中均优于现有的最先进技术。
项目页面:https://research.nvidia.com/labs/toronto-ai/LuxDiT/