语言模型中线性真理编码的出现

发表
Shauli RavfogelShauli Ravfogel 提交
作者: Shauli Ravfogel, Gilad Yehudai, Tal Linzen, Joan Bruna, Alberto Bietti

摘要

AI 生成总结
一个单层Transformer模型展示了通过记忆和随后的线性分离,语言模型中如何能出现将真假陈述区分开的线性子空间。
最近的探测研究揭示,大型语言模型展现出区分真假陈述的线性子空间,但其出现机制尚不清楚。我们引入了一个透明的单层Transformer玩具模型,该模型能够端到端地再现这种真理子空间,并揭示了它们产生的一种具体路径。我们研究了一个简单的设定,在该设定中真理编码可以出现:一个数据分布,其中事实陈述与其他事实陈述(反之亦然)共同出现,这促使模型学习这种区别,以降低未来标记上的语言模型损失。我们通过预训练语言模型的实验证实了这一模式。最后,在玩具设定中,我们观察到两阶段学习动态:网络首先在几个步骤中记忆个别事实关联,然后——在更长的时间范围内——学习线性区分真假,这反过来又降低了语言模型损失。总之,这些结果提供了机制演示和经验动机,说明了语言模型中线性真理表征如何以及为何能够出现。
查看 arXiv 页面查看 PDF
语言模型中线性真理编码的出现

评论

Shauli RavfogelShauli Ravfogel
论文提交者

我们提出了一种用于 Transformer 中线性真相编码的易处理玩具模型。