⏶4
从音频嵌入中进行偏好感知音乐检索
发表
由
Matteo Spanio 提交
作者:
Matteo Spanio, Antonio Rodà
摘要
AI 生成总结
评估了 HEAR 系列的音频编码器在品味预测方面的表现,其中门控晚期融合显示出卓越的秩相关性,最佳模型在保留音乐上达到了人类水平的准确度。声音和味觉之间的跨模态对应关系在心理学和神经科学中已得到充分证实,但在基于内容的多媒体检索中却基本缺失。我们将“从音频预测味觉”形式化为一个基于内容的音乐信息检索基准,该基准建立在一个经过感知验证的多源语料库之上,比较了来自四个HEAR家族的十个冻结音频编码器在共享多任务回归头下的表现,其中门控后期融合作为可配置变体。为了评估模型的有效性,我们计算了绝对误差和秩相关性。最强的系统在宏观RMSE为0.134的范围内预测出五种味觉;在保留的真实音乐上,它们的误差小于单个评估者与共识偏差的一半(RMSE 0.13 vs. 0.28),因此该模型比普通人类评估者更密切地跟踪群体共识,并且远低于先前最先进的基线(0.219)。在绝对误差方面,编码器在统计上是平坦的,单个VGGish与最佳融合匹配,但门控后期融合的优势仅限于秩相关性(宏观Pearson r 0.724 vs. 0.666)。作为基于内容的检索索引进行操作时,预测的味觉空间比CLAP-text基线(其结果处于随机水平)更忠实地对309个项目池进行排名;脊探针和音频带阻滤波器削弱实验读取了针对已记录声音-味觉对应关系的最强表示。
基于音频嵌入的味觉感知音乐检索 🎵🍫
我们能否仅凭音乐的音频来预测它听起来是甜、苦、咸、酸还是辣?
在这项工作中,我们引入了一个基于内容的音乐检索基准,用于从音频预测味觉。我们在统一的冻结编码器协议下比较了10个预训练音频编码器(HEAR家族),并展示了:
• 🎯 最佳模型实现了0.134 RMSE,超越了之前的最新技术水平(0.219 RMSE)。
• 👥 在真实音乐上,预测比普通人类评估者更接近共识(0.13 vs. 0.28 RMSE)。
• 🔎 所学习的5D味觉空间实现了基于味觉的音乐检索,显著优于CLAP-text基线。
• 🧠 我们还提供了基于心理物理学的可解释性,将学习到的表示与已知的声音-味觉对应关系联系起来。
据我们所知,这是首个将从音频预测味觉框定为音乐信息检索任务的基准。
论文:基于音频嵌入的味觉感知音乐检索