PixCon: 用于基础模型半监督分割的干净-正向对比学习

发表
Ebenezer TarubingaEbenezer Tarubinga 提交
作者: Ebenezer TarubingaEbenezer Tarubinga

摘要

AI 生成总结
PixCon 是一种半监督语义分割框架,它采用干净正像素对比学习和每个类别的内存库,以提高相对于现有方法的准确性。
半监督语义分割 (SSSS) 长期以来一直围绕一个问题:信任哪些伪标签?并通过越来越仔细的置信度过滤来回答。基础骨干改变了这一现状:在 DINOv2 教师模型下,严格的阈值已经能保留一个经测量 98% 干净的伪标签集,因此剩余的准确性不再取决于过滤器,而取决于嵌入空间如何按类别构建。我们提出了 PixCon,一个干净正像素对比框架。PixCon 维护一个每个类别的内存库,该库只接受学生已正确分类的已标记像素,从而在构建时保证了一个无污染的正集 (ρ_F=0),这与以前从置信度过滤的伪标签构建的对比 SSSS 库 (ReCo, U^2PL) 不同。它是一个基于一致性骨干的单分支,不增加推理时参数,也无需银行特定的阈值。对监督 InfoNCE 梯度的一阶分析解释了为什么污染有害:其假正项按 ρ_F/(1-ρ_F) 比例缩放,我们测量了该值(Pascal 上为 0.018,ADE20K 上为 0.106),而不是假设。在 Pascal VOC、Cityscapes 和 ADE20K 上,PixCon 在计算匹配的单开关协议下,与强大的基于 DINOv2 的 UniMatch V2 基线持平或有所改进:它改进了每个 Pascal-1/8 种子(每个种子增益约 +0.2 mIoU),其三种子平均值达到 87.90,即已发布的 UniMatch V2-B 数据。由于在基础模型教师下污染已经很少见,我们的分析表明 ρ_F=0 的保证主要是在教师模型弱化时作为鲁棒性发挥作用,而准确性增益则来自更干净的正监督,这使得干净正对比成为基础模型 SSSS 的一个鲁棒、低成本的默认选择。
查看 arXiv 页面查看 PDF

评论

Ebenezer TarubingaEbenezer Tarubinga
论文作者
论文提交者

基础骨干网络改变了半监督分割范式:借助DINOv2教师模型,严格的置信度阈值已能保留一个经过测量的约98%干净的伪标签集,因此,剩余的准确性取决于嵌入空间如何按类别构建,而非取决于过滤器。PixCon在UniMatch V2骨干网络上增加了一个干净正向的像素对比分支:一个每类别记忆库,仅接受学生模型已正确分类的已标记像素,从而通过构建提供了一个无污染的正向集(ρ_F = 0),且无推理时参数,也无针对记忆库的特定阈值。在Pascal VOC、Cityscapes和ADE20K数据集上进行的计算量匹配的单次切换比较中,它与强大的DINOv2 UniMatch V2基线持平或有所改进;在Pascal-1/8上,它改进了每个随机种子,其三种子平均值达到了已发布的UniMatch V2-B数据。

Selection_003
PixCon与已发表的最强半监督结果持平,并大幅超越了基础模型之前的领域。