⏶3
用于音节分词的说话人解耦块式回归
发表
由
Ryota Komatsu 提交
作者:
Ryota Komatsu, Kota Kawakita, Takuma Okamoto, Takahiro Shinozaki
摘要
AI 生成总结
一种说话人解耦的音节分词器将扰动的学生表示回归到干净的教师目标,以提高音节边界检测和语音语言建模性能。无监督音节分词旨在从原始语音中学习离散的音节 token,以捕获潜在的与语言内容相关的结构。最近的音节分词方法采用预训练 HuBERT 的教师-学生蒸馏来将潜在语音帧表示组织成音节片段。然而,当使用话语级别的交叉熵目标进行训练时,模型预测的是说话人身份而非语言内容,从而损害了音节 token 的纯度。为了解决这个问题,我们提出了一种说话人解耦的音节分词器,它在固定长度的块中将说话人扰动的学生表示回归到干净的教师目标。实验结果表明,我们提出的方法在音节边界检测和音节片段聚类方面达到了最先进的性能。此外,在我们的音节 token 上训练的语音语言模型在句法和语义理解方面比音素级别的 SpiRit-LM 相对提高了 7%。

在这篇IEEE OJSP论文中,我们介绍了SylReg-LM 7B,一个高效可扩展的交错音节文本语言模型!
