IEMOCAP: interactive emotional dyadic motion capture database
PulseAugur coverage of IEMOCAP: interactive emotional dyadic motion capture database — every cluster mentioning IEMOCAP: interactive emotional dyadic motion capture database across labs, papers, and developer communities, ranked by signal.
6 天有情绪数据
-
新型DSSM-CRF模型提升对话语音情感识别能力
研究人员开发了一种名为DSSM-CRF的新型双尺度状态空间模型,用于对话中的语音情感识别。该模型通过使用双向状态空间模型在帧和对话尺度上编码语音表示,将跨说话人上下文影响与说话人内部情感演变分离开来。然后,系统为每个说话人采用动态条件随机场链,从而能够根据上下文相关的话语预测情感转换。DSSM-CRF在基准数据集上表现强劲,在IEMOCAP上实现了75.81%的UA和74.90%的WA,在MELD上实现了54.72%的WA和49.31%的WF1。
-
新框架利用基于注意力的融合增强多模态情感识别
研究人员开发了一种新的多模态情感识别框架,集成了音频和视觉数据。音频部分使用Wav2Vec2、MFCC和声学描述符,并通过BiLSTM进行处理,而视频部分则采用ResNet50-BiLSTM架构。多头注意力机制用于融合这些特征,使模型能够自适应地权衡每个模态的贡献。在MELD和IEMOCAP数据集上的实验表明,与现有方法相比,在数据不平衡的情况下,性能有了显著提升。
-
新的SISER模型通过对抗性训练改进语音情感识别
研究人员开发了SISER,一种新颖的语音情感识别方法,解决了数据稀缺和说话人可变性问题。通过在对抗性训练框架中集成预训练的wav2vec 2.0模型进行特征提取和ECAPA-TDNN模型进行说话人判别,SISER旨在提高情感识别系统的泛化能力。在IEMOCAP数据库上的实验表明,SISER的准确率显著提高,达到60.63%,优于基线方法。
-
新的PriMD框架通过处理缺失数据来增强情感识别能力
研究人员开发了一个名为原始记忆蒸馏(PriMD)的新框架,用于在某些数据模态缺失时改进多模态情感识别(MER)系统。与以往将缺失模态整体处理的方法不同,PriMD将共享语义与模态特定信息解耦,并将后者蒸馏成可学习的语义原始信息。这使得系统在模态缺失时能够从记忆库中动态检索相关信息,从而获得更稳定的表示和增强的鲁棒性。在IEMOCAP、CMU-MOSI和CMU-MOSEI等数据集上的实验表明,PriMD在各种缺失模态场景下均取得了最先进…
-
新研究探索LLM在不同层级和语言中的情感检测
研究人员正在探索新的方法来增强大型语言模型(LLM)的情感检测能力,方法是研究情感在不同层级和语言中的表示方式。一项研究考察了LLM在社交媒体帖子和叙事等各种文本类型中的情感表达,发现情感的可访问深度因语料库而异,并且对特定模型层级的干预可以显著提高准确性。另一种方法将LLM与答案集编程相结合,以提高情感识别的一致性并降低计算成本,即使在未经微调的情况下也能显示出收益。第三篇论文表明,源自上下文演示的功能向量可以有效地引导LLM在多语…
-
新型适配器DiaRelay增强LLM在对话中的情感识别能力
研究人员开发了DiaRelay,这是一种用于大型语言模型(LLM)的新型适配器,旨在改进对话中的情感识别(ERC)。与使用固定上下文窗口或重新编码整个历史记录的现有方法不同,DiaRelay采用恒定大小的内存来选择性地聚合和传播历史对话证据。这种方法可以在不增加计算成本或上下文长度的情况下,更好地跟踪远处轮次中细微的情感线索。在MELD和IEMOCAP数据集上的实验表明,DiaRelay以最少的训练参数实现了最先进的结果。
-
新框架平衡AI分类准确性与可解释性
研究人员开发了一个新的多模态分类框架,在准确性和可解释性之间取得了平衡。该框架利用基于树的集成方法,特别是线性判别树(LDT)、线性判别森林(LDF)和线性判别AdaBoost(LDAB),来处理和分类异构数据流,如文本、音频和视觉信息。所提出的方法在F1-mod增益和准确性方面优于现有的Transformer模型和基线可解释方法,同时在特征重要性方面与人类标注的一致性也更高。
-
新的AI模型旨在实现更深层次的情感理解和推理 · 跟踪5个来源
研究人员正在开发能够理解和推理人类情感的高级多模态AI模型。几篇新论文为此目的引入了框架和基准,重点在于整合语言和非语言线索。这些努力旨在提高AI识别表达和引发情感、评估个性和进行更细致情感互动能力,超越简单的输入-输出映射,转向更受认知启发的推理过程。
-
HyPASE框架使用双曲几何进行高效LALM微调
研究人员开发了HyPASE,一个利用双曲几何进行参数高效微调大型音频语言模型(LALMs)以用于语音情感识别(SER)的新型框架。与在欧几里得空间中操作的传统方法不同,HyPASE采用了Poincaré球模型来更好地捕捉情感线索的多粒度性。该框架包括一个双曲几何适配器(HGA)和一个情感感知多容量跨模态聚合器(EMCA),它们共同提高了在MELD和IEMOCAP等基准测试上的性能,尤其是在类别不平衡数据集上。这种方法为将LALMs适应…
-
新的AMRD方法赋能轻量级语音情感识别模型
研究人员开发了一种新颖的自适应多教师关系蒸馏(AMRD)方法,用于创建适用于设备端应用的轻量级语音情感识别(SER)模型。AMRD通过根据教师模型的批次可靠性自适应加权,并结合关系蒸馏损失来捕获样本间的结构信息,从而解决了知识蒸馏中的挑战。在IEMOCAP和CREMA-D数据集上的实验表明,AMRD在各种学生模型架构上均优于传统的单教师蒸馏基线。
-
新框架增强对话中的多模态情感识别 · 已追踪 2 个来源
两篇新的研究论文提出了用于对话中多模态情感识别的新颖框架。第一个,EmoEUS,引入了一个显式的、基于学习到的方差估计动态加权模态的不确定性监督框架。第二个,EII-SCL,利用时间窗口内的情绪惯性来指导监督对比学习目标。这两种方法在 IEMOCAP 和 MELD 数据集上的表现均优于现有的最先进方法。
-
新研究挑战了人工智能情感分析中处理缺失数据的传统方法
两篇新研究论文探讨了处理多模态情感分析中缺失数据的新方法。第一篇论文介绍了 Missing-by-Design (MBD) 框架,该框架结合了结构化学习和参数修改,用于可认证的模态删除,允许选择性地移除敏感数据同时保持任务性能。第二篇论文质疑了始终修复缺失模态的必要性,提出了 SIEVE (Sufficiency-Informed Evidential Valve),它学习在样本基础上决定是否修复缺失数据,改进了现有的先修复方法。
-
新型ADMC模型增强了多模态情感和意图识别能力
研究人员开发了ADMC,一种基于注意力的扩散模型,旨在补全多模态情感和意图识别中的缺失模态特征。该框架为每种模态训练独立的特征提取网络,以防止过度耦合,并使用基于注意力的扩散网络(ADN)生成与真实多模态分布紧密匹配的缺失特征。ADMC方法在IEMOCAP和MIntRec基准测试中展现了最先进的性能,在模态缺失和完整两种场景下均有效。
-
新指标ALAS评估音频语言模型对齐情况
研究人员开发了ALAS(自动潜在对齐分数),用于评估音频语言模型将音频帧与文本标记对齐的程度。该模型和任务无关的指标分析了大型语言模型的隐藏状态,将音频和文本表示与源自Whisper的参考进行比较。ALAS仅需要一个固定的前向传播和一个现成的ASR参考,无需训练或拟合分类器。当应用于四个开源Speech-LLM时,ALAS显示对齐深度反映了音频编码器设计和任务需求,并且可以识别出在没有真正音频基础的情况下表现良好的模型。
-
新研究将对话语境与情感识别准确性联系起来
研究人员开发了一种通过分析对话语境和话语标记来识别对话中情感的新方法。研究发现,对话历史,特别是前10-30轮对话,是情感识别最重要的因素,其性能很快达到平台期。在仅有语句的情况下,分层句子表示是有益的,但在有对话历史的情况下则不太有益。研究还发现特定情感与话语标记位置之间存在相关性,表明悲伤等情感更依赖于语境。
-
音频语言模型通过声学线索改进语音情感识别
研究人员开发了一种通过整合明确的声学线索来改进音频语言模型中语音情感识别的方法。通过从副语言特征中提取六个可解释的声学概念标记,他们发现将这些标记与音频输入对齐可以提高模型性能。相反,错位或损坏的标记会降低准确性,这表明模型对符号线索通道敏感,同时保留了一些音频信号基础。
-
联邦学习框架优化语音情感识别训练
研究人员开发了一个新的联邦学习框架,旨在优化在各种边缘设备上进行语音情感识别的训练。该方法集成了硬件分析和自适应客户端选择,以减少训练时间和通信成本。实验表明,训练时间和通信开销显著降低,同时实现了具有竞争力的准确性。
-
新框架通过课程学习提升情感识别能力
研究人员开发了一个名为自定进度课程学习(SPCL)的新框架,以改进多模态对话情感识别。该方法通过动态地引导训练过程从易到难,解决了模态不对齐和学习不平衡等挑战。在IEMOCAP和MELD数据集上的实验显示性能显著提升,SPCL在IEMOCAP上将F1分数提高了高达6.6%,在MELD上提高了10.4%,证明了其作为即插即用模块的有效性。
-
新的ML-SAN模型通过适应说话人特征来改进AI情感识别
研究人员开发了一个名为ML-SAN的新模型,通过考虑个体表达差异来改进对话中的情感识别。这个多级说话人自适应网络使用一个三阶段过程来校准输入特征,根据说话人身份调整模态信任度,并在潜在空间中保持说话人一致性。在MELD和IEMOCAP数据集上的测试表明,ML-SAN表现更好,尤其是在不太常见的感情类别和多样化的说话人方面。