IEMOCAP: interactive emotional dyadic motion capture database
PulseAugur coverage of IEMOCAP: interactive emotional dyadic motion capture database — every cluster mentioning IEMOCAP: interactive emotional dyadic motion capture database across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新的EII-SCL方法改进了对话情感识别
研究人员开发了一种名为EII-SCL的新方法,以改进对话中的多模态情感识别。该方法专门解决了当前模型常常忽略的情绪惯性问题。通过将情绪惯性纳入先验知识,EII-SCL提高了预测对话中情绪转变的准确性。在IEMOCAP和MELD数据集上进行的实验表明,EII-SCL的性能始终优于现有的最先进方法。
-
新的SIEVE方法质疑情感分析中修复所有缺失模态的必要性
研究人员质疑了多模态情感分析(MSA)中优先修复缺失模态的主流方法。一项新的分析表明,全模态输入仅对一小部分样本是最佳的,修复每个模态的必要性高度依赖于样本。为了解决这个问题,开发了一种名为SIEVE(Sufficiency-Informed Evidential Valve)的新方法。SIEVE学习在样本基础上决定是否修复缺失模态,作为一个即插即用的模块,可以增强现有的修复技术。
-
新型ADMC模型增强了多模态情感和意图识别能力
研究人员开发了ADMC,一种基于注意力的扩散模型,旨在补全多模态情感和意图识别中的缺失模态特征。该框架为每种模态训练独立的特征提取网络,以防止过度耦合,并使用基于注意力的扩散网络(ADN)生成与真实多模态分布紧密匹配的缺失特征。ADMC方法在IEMOCAP和MIntRec基准测试中展现了最先进的性能,在模态缺失和完整两种场景下均有效。
-
新指标ALAS评估音频语言模型对齐情况
研究人员开发了ALAS(自动潜在对齐分数),用于评估音频语言模型将音频帧与文本标记对齐的程度。该模型和任务无关的指标分析了大型语言模型的隐藏状态,将音频和文本表示与源自Whisper的参考进行比较。ALAS仅需要一个固定的前向传播和一个现成的ASR参考,无需训练或拟合分类器。当应用于四个开源Speech-LLM时,ALAS显示对齐深度反映了音频编码器设计和任务需求,并且可以识别出在没有真正音频基础的情况下表现良好的模型。
-
新研究将对话语境与情感识别准确性联系起来
研究人员开发了一种通过分析对话语境和话语标记来识别对话中情感的新方法。研究发现,对话历史,特别是前10-30轮对话,是情感识别最重要的因素,其性能很快达到平台期。在仅有语句的情况下,分层句子表示是有益的,但在有对话历史的情况下则不太有益。研究还发现特定情感与话语标记位置之间存在相关性,表明悲伤等情感更依赖于语境。
-
音频语言模型通过声学线索改进语音情感识别
研究人员开发了一种通过整合明确的声学线索来改进音频语言模型中语音情感识别的方法。通过从副语言特征中提取六个可解释的声学概念标记,他们发现将这些标记与音频输入对齐可以提高模型性能。相反,错位或损坏的标记会降低准确性,这表明模型对符号线索通道敏感,同时保留了一些音频信号基础。
-
联邦学习框架优化语音情感识别训练
研究人员开发了一个新的联邦学习框架,旨在优化在各种边缘设备上进行语音情感识别的训练。该方法集成了硬件分析和自适应客户端选择,以减少训练时间和通信成本。实验表明,训练时间和通信开销显著降低,同时实现了具有竞争力的准确性。
-
新框架通过课程学习提升情感识别能力
研究人员开发了一个名为自定进度课程学习(SPCL)的新框架,以改进多模态对话情感识别。该方法通过动态地引导训练过程从易到难,解决了模态不对齐和学习不平衡等挑战。在IEMOCAP和MELD数据集上的实验显示性能显著提升,SPCL在IEMOCAP上将F1分数提高了高达6.6%,在MELD上提高了10.4%,证明了其作为即插即用模块的有效性。
-
新的ML-SAN模型通过适应说话人特征来改进AI情感识别
研究人员开发了一个名为ML-SAN的新模型,通过考虑个体表达差异来改进对话中的情感识别。这个多级说话人自适应网络使用一个三阶段过程来校准输入特征,根据说话人身份调整模态信任度,并在潜在空间中保持说话人一致性。在MELD和IEMOCAP数据集上的测试表明,ML-SAN表现更好,尤其是在不太常见的感情类别和多样化的说话人方面。