基于语音的层级跨语言抑郁症检测:对比对齐分析

发表
Anisha PattanayakAnisha Pattanayak 提交
作者: Anisha PattanayakAnisha Pattanayak, Hanie Kang, Huang-Cheng Chou, Shrikanth Narayanan, Sudarsana Reddy Kadiri

摘要

AI 生成总结
一个有监督的对比对齐框架将英语和普通话的 WavLM 嵌入映射到共享的临床空间中用于抑郁症检测,解决了跨语言泛化挑战,并揭示了由说话人身份泄露引起的性能伪影。
不同语言人群在抑郁症的诊断和临床表现上存在显著差异。基于语音的抑郁症检测在单语环境中表现良好,但跨语言泛化仍然是一个开放的挑战。一个关键原因是,先前的工作使用段级随机分割而不进行说话者分组,导致身份泄露,从而夸大了报告的指标。我们提出了CLeaD,一个有监督的对比对齐框架,它将来自英语和普通话的WavLM嵌入映射到一个共享的临床空间中,无需并行数据或目标语言微调。在留一说话者法评估下,对52位普通话说话者的评估显示,对比对齐略优于基线(F1:0.640 vs. 0.622)。它还在中间层(7-8层)提高了抑郁类别召回率,尽管小测试集限制了泛化能力。有两个发现仍然稳健:模型扩展会降低跨语言性能,同时提高单语英语性能;说话者身份泄露人为地将先前报告的普通话F1分数夸大到0.954,我们重现并量化了这一假象。
查看 arXiv 页面查看 PDF

评论

Anisha PattanayakAnisha Pattanayak
论文作者
论文提交者

抑郁症在不同语言中的表现形式(视觉或听觉)并不相同,但大多数基于语音的检测模型仅在其训练语言上进行测试。更糟糕的是,之前的工作在分割数据时没有按说话人分组,导致模型悄悄地记忆了声音而不是检测抑郁症。我们构建了CLeaD,一个监督对比框架,它将英语和普通话的WavLM嵌入对齐到一个共享的临床空间中,无需并行数据或目标语言微调。在52位普通话说话人上进行“留一说话人交叉验证”评估,它略微优于基线(F1:0.640 对 0.622)。两个发现非常有力:更大的模型在跨语言迁移方面表现更差,但在英语方面表现更好;以及说话人泄露将之前普通话的F1分数夸大到了0.954。我们重现并量化了这一假象。