MANCE:流形感知概念擦除

发表
Matan AvitanMatan Avitan 提交
作者: Matan AvitanMatan Avitan, Yoav Goldberg, Yanai Elazar

摘要

AI 生成总结
流形约束假设通过将更新投影到估计的表示流形上,实现了改进的概念擦除,在非线性概念去除方面取得了最先进的结果。
概念擦除旨在从表示中删除目标概念,同时保留其中编码的其他信息。这很困难,因为表示编码了许多通常与擦除目标相关的概念,因此删除目标可能会损害它们。我们提出了流形约束假设(MCH):如果自然表示集中在结构化的低维流形上,那么干预措施应限制在该流形上,并在干预过程中更好地保留表示中编码的其他信息。我们在一种新的概念擦除方法中实例化了MCH:流形感知概念擦除(MANCE)。MANCE使用来自预测目标概念的分类器的信号对表示进行迭代更新。我们使用从自然输入获得的表示来估计流形,然后将概念删除更新投影到估计的流形上。我们对涵盖文本和视觉的119个设置进行了广泛评估,包括13个语言模型、三个NLP概念和40个CelebA-CLIP属性。在先前方法的基础上采用MANCE显示出持续改进的泄露结果。我们还引入了MANCE+和MANCE++,它们在采用MANCE之前预置了一个闭式擦除算法,相对于匹配的全空间更新,实现了更好的泄露-外科性权衡。MANCE++,我们最好的方法,在非线性概念擦除方面取得了最先进的结果。这些结果支持MCH在擦除设置中的作用:干预措施应限制在自然表示流形上。
查看 arXiv 页面查看 PDF

评论

Matan AvitanMatan Avitan
论文作者
论文提交者

总结:这是从模型激活中移除概念(例如,性别、安全性)的最强方法,同时在对其他受控概念的附带损害方面保持精确。

它还建立在一个很好的几何假设之上:
自然输入产生的隐藏状态并非均匀填充整个表示空间。我们假设它们占据的是一个由编码器和数据分布形成的结构化、低维区域,我们将其建模为一个流形。

这使我们提出了《流形约束假设》(𝘔𝘢𝘯𝘪𝘧𝘰𝘭𝘥 𝘊𝘰𝘯𝘴𝘵𝘳𝘢𝘪𝘯𝘵 𝘏𝘺𝘱𝘰𝘵𝘩𝘦𝘴𝘪𝘴,𝘔𝘊𝘏),在对目标概念具有匹配效果的干预中,流形约束干预比无约束干预能更好地保留表示中编码的其他概念。

我们通过流形的局部一阶近似来操作这一假设,使用从自然输入中获得的切线方向。

在119种设置(多种模型家族、模态和目标概念)中,MANCE⁺⁺在概念擦除方面树立了新的技术标准,同时也在大多数设置中改进了之前的擦除器。

Saar LitmanovichSaar Litmanovich

棒!