研究人员开发了一种新的多模态情感识别框架,集成了音频和视觉数据。音频部分使用Wav2Vec2、MFCC和声学描述符,并通过BiLSTM进行处理,而视频部分则采用ResNet50-BiLSTM架构。多头注意力机制用于融合这些特征,使模型能够自适应地权衡每个模态的贡献。在MELD和IEMOCAP数据集上的实验表明,与现有方法相比,在数据不平衡的情况下,性能有了显著提升。 AI
影响 这项研究可能为人类计算机交互、教育和医疗保健等应用带来更准确、更鲁棒的情感识别系统。
排序理由 该集群包含一篇详细介绍新颖多模态情感识别框架的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- BiLSTM
- IEMOCAP: interactive emotional dyadic motion capture database
- MELD
- Mel Frequency Cepstral Coefficients
- ResNet50
- Wav2Vec2
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →