CREMA-D
PulseAugur coverage of CREMA-D — every cluster mentioning CREMA-D across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
音频模型研究详解计算-性能权衡
一篇新研究论文探讨了音频模型计算资源的最佳分配,重点关注自动语音识别(ASR)和语音情感识别(SER)。该研究提出了一个分析模型大小、输入长度和表示分辨率的框架,以在固定的计算预算下最大化性能。在LibriSpeech和CREMA-D数据集上的实验表明,增加模型大小会带来收益递减,SER的最佳音频时长约为4秒,降低编码器令牌分辨率具有成本效益。
-
新的AMRD方法赋能轻量级语音情感识别模型
研究人员开发了一种新颖的自适应多教师关系蒸馏(AMRD)方法,用于创建适用于设备端应用的轻量级语音情感识别(SER)模型。AMRD通过根据教师模型的批次可靠性自适应加权,并结合关系蒸馏损失来捕获样本间的结构信息,从而解决了知识蒸馏中的挑战。在IEMOCAP和CREMA-D数据集上的实验表明,AMRD在各种学生模型架构上均优于传统的单教师蒸馏基线。
-
新的深度学习模型提高了语音情感识别的准确性和可解释性
研究人员开发了用于语音情感识别(SER)的新深度学习技术,该领域对于推进人机交互至关重要。一项研究介绍了一种混合DCRF-BiLSTM模型,该模型在多个数据集上均取得了高准确率,包括对五个组合数据集的全新综合评估。另一篇论文提出了一种可解释且轻量级的紧凑型卷积神经网络,该网络通过Grad-CAM可视化有影响力的区域,平衡了识别性能与透明度和效率。
-
新的MARS框架通过残差引导解决不完整多模态学习问题
研究人员开发了MARS(Missingness-Aware Residual-guided Specialization,缺失感知残差引导专业化),一个用于不完整多模态学习的新框架。该方法通过根据缺失如何重塑表示来引导专家专业化,从而解决了推理过程中缺失数据模态的挑战。MARS在训练期间利用对比完整和不完整数据表示所产生的特权残差信号,将样本导向专业化专家。然后,一个特征路由器仅使用不完整输入来学习模仿这种路由行为,从而实现实际部署。
-
上部面部线索在噪声下增强视听句子识别
研究人员探讨了上部面部情感线索对视听句子识别的影响,特别是在音频质量下降的情况下。他们的研究利用CREMA-D语料库,在各种面部线索条件下训练分类器,包括仅音频、带下部面部特征的音频、带上部面部特征的音频以及两者都带的音频。研究结果表明,虽然下部面部特征显著提高了在嘈杂音频中的鲁棒性,但上部面部情感线索有助于更好地校准和估计置信度,这表明表情丰富的面部信息在多模态交互系统中发挥着作用。
-
AI框架使用混合精度进行设备端双相激越检测
研究人员开发了一个名为MP-IB的新框架,用于在语音数据中解耦稳定的说话者特征与不稳定的情感状态,专门用于资源受限设备上的双相情感障碍激越检测。该系统利用混合精度量化,其中不同的数值精度(特征使用FP16,状态使用INT4)创建信息瓶颈来分离这些元素。该方法在Bridge2AI-Voice数据集上达到了0.117的rho值,优于现有方法,并实现了具有小内存占用的实时监控。