研究人员开发了SISER,一种新颖的语音情感识别方法,解决了数据稀缺和说话人可变性问题。通过在对抗性训练框架中集成预训练的wav2vec 2.0模型进行特征提取和ECAPA-TDNN模型进行说话人判别,SISER旨在提高情感识别系统的泛化能力。在IEMOCAP数据库上的实验表明,SISER的准确率显著提高,达到60.63%,优于基线方法。 AI
影响 这项研究可能带来更强大、更具泛化能力的语音情感识别系统,影响人机交互和情感计算等应用。
排序理由 该集群包含一篇学术论文,详细介绍了一种新的语音情感识别模型和方法。 [lever_c_demoted from research: ic=1 ai=1.0]
- ECAPA-TDNN
- IEMOCAP: interactive emotional dyadic motion capture database
- Siser
- wav2vec 2.0: A Framework for Self-Supervised Learning of Speech Representations
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →