CREMA-D
PulseAugur coverage of CREMA-D — every cluster mentioning CREMA-D across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
概念瓶颈模型增强语音情感识别的可解释性
研究人员已将先前用于图像分类的概念瓶颈模型应用于语音情感识别(SER)。此举旨在提高SER系统的可解释性,特别是那些利用大型语言模型(LLM)的系统。该研究在CREMA-D、IEMOCAP和MELD数据集上测试了三个LLM,从语音转录文本、声学描述和说话人属性中提取概念。研究结果表明,在零样本设置下,LLM严重偏向于语音转录文本,显著降低了性能指标。微调可以减轻这种偏见,并且移除诸如语速或强度级别等特定声学特征可以改变个体预测,而不会…
-
ModalShare 优化多模态分层学习的带宽
研究人员开发了 ModalShare,一个用于优化多模态分层学习中带宽分配的新颖系统。该方法根据不同模态对最终预测的贡献动态分配带宽,而不是平均分配。ModalShare 使用服务器计算的 Shapley 贡献分数来确定特定模态的保留比例,在匹配的负载水平下,在 CREMA-D 和 MVSA 等数据集上的准确率提高了多达 15.4 个百分点。
-
新的GUIDE框架控制多模态模型证据使用
研究人员推出了一种新颖的GUIDE框架,旨在控制大型多模态模型在遵循语言指令时如何利用内部证据。与可能依赖表面线索的先前模型不同,GUIDE在推理和生成过程中采用指令条件门控来调节证据通路。该框架已证明其能够在推理、分类和生成等各种多模态任务中诱导证据依赖性的结构化重新分配,同时保持任务性能。在GQA和TextVQA等数据集上的实验表明,GUIDE增强了对目标证据扰动的鲁棒性,并实现了证据来源的可控调制。
-
音频模型研究详解计算-性能权衡
一篇新研究论文探讨了音频模型计算资源的最佳分配,重点关注自动语音识别(ASR)和语音情感识别(SER)。该研究提出了一个分析模型大小、输入长度和表示分辨率的框架,以在固定的计算预算下最大化性能。在LibriSpeech和CREMA-D数据集上的实验表明,增加模型大小会带来收益递减,SER的最佳音频时长约为4秒,降低编码器令牌分辨率具有成本效益。
-
新的AMRD方法赋能轻量级语音情感识别模型
研究人员开发了一种新颖的自适应多教师关系蒸馏(AMRD)方法,用于创建适用于设备端应用的轻量级语音情感识别(SER)模型。AMRD通过根据教师模型的批次可靠性自适应加权,并结合关系蒸馏损失来捕获样本间的结构信息,从而解决了知识蒸馏中的挑战。在IEMOCAP和CREMA-D数据集上的实验表明,AMRD在各种学生模型架构上均优于传统的单教师蒸馏基线。
-
新的深度学习模型提高了语音情感识别的准确性和可解释性
研究人员开发了用于语音情感识别(SER)的新深度学习技术,该领域对于推进人机交互至关重要。一项研究介绍了一种混合DCRF-BiLSTM模型,该模型在多个数据集上均取得了高准确率,包括对五个组合数据集的全新综合评估。另一篇论文提出了一种可解释且轻量级的紧凑型卷积神经网络,该网络通过Grad-CAM可视化有影响力的区域,平衡了识别性能与透明度和效率。
-
新的MARS框架通过残差引导解决不完整多模态学习问题
研究人员开发了MARS(Missingness-Aware Residual-guided Specialization,缺失感知残差引导专业化),一个用于不完整多模态学习的新框架。该方法通过根据缺失如何重塑表示来引导专家专业化,从而解决了推理过程中缺失数据模态的挑战。MARS在训练期间利用对比完整和不完整数据表示所产生的特权残差信号,将样本导向专业化专家。然后,一个特征路由器仅使用不完整输入来学习模仿这种路由行为,从而实现实际部署。
-
上部面部线索在噪声下增强视听句子识别
研究人员探讨了上部面部情感线索对视听句子识别的影响,特别是在音频质量下降的情况下。他们的研究利用CREMA-D语料库,在各种面部线索条件下训练分类器,包括仅音频、带下部面部特征的音频、带上部面部特征的音频以及两者都带的音频。研究结果表明,虽然下部面部特征显著提高了在嘈杂音频中的鲁棒性,但上部面部情感线索有助于更好地校准和估计置信度,这表明表情丰富的面部信息在多模态交互系统中发挥着作用。
-
AI框架使用混合精度进行设备端双相激越检测
研究人员开发了一个名为MP-IB的新框架,用于在语音数据中解耦稳定的说话者特征与不稳定的情感状态,专门用于资源受限设备上的双相情感障碍激越检测。该系统利用混合精度量化,其中不同的数值精度(特征使用FP16,状态使用INT4)创建信息瓶颈来分离这些元素。该方法在Bridge2AI-Voice数据集上达到了0.117的rho值,优于现有方法,并实现了具有小内存占用的实时监控。