在片段表示上采用说话者感知的时间聚合策略用于二元交互中的抑郁症检测:一项基准研究

发表
Anisha PattanayakAnisha Pattanayak 提交
作者: Anisha PattanayakAnisha Pattanayak, Huang-Cheng Chou, Shrikanth Narayanan, Sudarsana Reddy Kadiri

摘要

AI 生成总结
用于基于语音的抑郁症检测的时间聚合方法在不同的骨干网络和训练运行中表现出不一致的性能,强调了对稳健基准测试标准的需求。
基于语音的抑郁症检测将短音频片段的特征压缩成一个说话者级别的决策,这个称为时间聚合的步骤很少单独研究。大多数基准都固定一个自监督编码器和一个手工选择的层,因此报告的增益可能反映的是整个管道,而不是聚合方法本身。我们引入了DEPOOL,一个受控基准,它在一个英语和普通话抑郁症语料库上,比较了六种聚合架构与六种冻结语音骨干,其中每种配置都会学习哪些骨干层是重要的,而不是手动固定一个。在由此产生的72种配置网格中,三分之一的配置会崩溃为预测每个说话者为单一类别,这是一个与骨干以及方法本身都相关的失败,并且在单次种子运行中最稳定的架构在跨种子重复训练时变得不可靠。对于临床语音中的时间聚合,对骨干和种子的鲁棒性,而不是单一管道的平均准确性,应该是一个一流的基准评估标准。
查看 arXiv 页面查看 PDF

评论

Anisha PattanayakAnisha Pattanayak
论文作者
论文提交者

语音抑郁症检测通常将许多短音频片段压缩成每个说话者一个决策(时间聚合),但由于大多数基准测试只锁定一个编码器和一个层,这一步骤几乎从未单独研究过。这使得很难判断报告的增益是来自聚合方法还是仅仅是流水线设置。我们构建了DEPOOL来正确测试这一点:在英语+普通话抑郁症数据集上,6种聚合方法 x 6个冻结语音骨干网络,其中每个设置都学习哪些层真正重要,而不是手动选择一个。结果:在所有72种配置中,三分之一的模型直接崩溃并为所有人预测一个类别(依赖于骨干网络,而非仅仅依赖于方法),并且在单次运行中看起来最稳定的架构在不同种子之间常常崩溃。结论:在对临床语音聚合进行基准测试时,骨干网络和种子之间的鲁棒性远比在某个固定流水线上的平均准确率重要得多。