研究人员已将先前用于图像分类的概念瓶颈模型应用于语音情感识别(SER)。此举旨在提高SER系统的可解释性,特别是那些利用大型语言模型(LLM)的系统。该研究在CREMA-D、IEMOCAP和MELD数据集上测试了三个LLM,从语音转录文本、声学描述和说话人属性中提取概念。研究结果表明,在零样本设置下,LLM严重偏向于语音转录文本,显著降低了性能指标。微调可以减轻这种偏见,并且移除诸如语速或强度级别等特定声学特征可以改变个体预测,而不会大幅影响整体性能。 AI
影响 引入了一种使基于LLM的语音情感识别更具可解释性的方法,有望提高模型调试和可信度。
排序理由 学术论文,详细介绍了概念瓶颈模型在语音情感识别中的新应用。[lever_c_demoted from research: ic=1 ai=1.0]
- Concept Bottleneck Models
- CREMA-D
- IEMOCAP: interactive emotional dyadic motion capture database
- large-language models
- MELD
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →