⏶135
从规模到速度:图像编辑的自适应测试时缩放
发表
由
xiaochonglinghu 提交
作者: Xiangyan Qu, Zhenlong Yuan, Jing Tang,
Rui Chen, Datao Tang, Meng Yu, Lei Sun, Yancheng Bai, Xiangxiang Chu, Gaopeng Gou, Gang Xiong, Yujun Cai
摘要
AI 生成总结
Image-CoT 方法通过 ADE-CoT 扩展到图像编辑领域,该方法通过自适应资源分配、特定编辑验证和机会性停止机制,提高了效率和性能。图像思维链 (Image-CoT) 是一种通过延长推理时间来提高图像生成的测试时扩展范式。大多数 Image-CoT 方法集中在文本到图像 (T2I) 生成上。与 T2I 生成不同,图像编辑是目标导向的:解空间受限于源图像和指令。这种不匹配导致将 Image-CoT 应用于编辑时面临三个挑战:固定采样预算导致的资源分配效率低下、使用通用 MLLM 评分产生的早期验证不可靠,以及大规模采样导致的冗余编辑结果。为此,我们提出了自适应编辑思维链 (ADE-CoT),这是一个按需测试时扩展框架,旨在提高编辑效率和性能。它包含三个关键策略:(1) 难度感知资源分配,根据预估的编辑难度分配动态预算;(2) 早期剪枝中的编辑特定验证,利用区域定位和描述一致性筛选有潜力的候选样本;(3) 深度优先机会性停止,在实例特定验证器的引导下,一旦发现符合意图的结果即停止生成。在三个基准测试中对三种最先进的编辑模型(Step1X-Edit、BAGEL、FLUX.1 Kontext)进行的广泛实验表明,ADE-CoT 实现了卓越的性能-效率平衡。在采样预算相当的情况下,ADE-CoT 比 Best-of-N 获得了更好的性能,且速度提升超过 2 倍。
图像编辑的自适应测试时缩放 CVPR26