PulseAugur
实时 11:05:16
实体 CREMA-D

CREMA-D

PulseAugur coverage of CREMA-D — every cluster mentioning CREMA-D across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 6
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 6
层级分布 · 90 天
主题
情绪 · 30 天

3 天有情绪数据

最近 · 第 1/1 页 · 共 6 条
  1. TOOL · CL_193685 ·

    音频模型研究详解计算-性能权衡

    一篇新研究论文探讨了音频模型计算资源的最佳分配,重点关注自动语音识别(ASR)和语音情感识别(SER)。该研究提出了一个分析模型大小、输入长度和表示分辨率的框架,以在固定的计算预算下最大化性能。在LibriSpeech和CREMA-D数据集上的实验表明,增加模型大小会带来收益递减,SER的最佳音频时长约为4秒,降低编码器令牌分辨率具有成本效益。

  2. TOOL · CL_174366 ·

    新的AMRD方法赋能轻量级语音情感识别模型

    研究人员开发了一种新颖的自适应多教师关系蒸馏(AMRD)方法,用于创建适用于设备端应用的轻量级语音情感识别(SER)模型。AMRD通过根据教师模型的批次可靠性自适应加权,并结合关系蒸馏损失来捕获样本间的结构信息,从而解决了知识蒸馏中的挑战。在IEMOCAP和CREMA-D数据集上的实验表明,AMRD在各种学生模型架构上均优于传统的单教师蒸馏基线。

  3. RESEARCH · CL_154189 ·

    新的深度学习模型提高了语音情感识别的准确性和可解释性

    研究人员开发了用于语音情感识别(SER)的新深度学习技术,该领域对于推进人机交互至关重要。一项研究介绍了一种混合DCRF-BiLSTM模型,该模型在多个数据集上均取得了高准确率,包括对五个组合数据集的全新综合评估。另一篇论文提出了一种可解释且轻量级的紧凑型卷积神经网络,该网络通过Grad-CAM可视化有影响力的区域,平衡了识别性能与透明度和效率。

  4. RESEARCH · CL_117272 ·

    新的MARS框架通过残差引导解决不完整多模态学习问题

    研究人员开发了MARS(Missingness-Aware Residual-guided Specialization,缺失感知残差引导专业化),一个用于不完整多模态学习的新框架。该方法通过根据缺失如何重塑表示来引导专家专业化,从而解决了推理过程中缺失数据模态的挑战。MARS在训练期间利用对比完整和不完整数据表示所产生的特权残差信号,将样本导向专业化专家。然后,一个特征路由器仅使用不完整输入来学习模仿这种路由行为,从而实现实际部署。

  5. TOOL · CL_65499 ·

    上部面部线索在噪声下增强视听句子识别

    研究人员探讨了上部面部情感线索对视听句子识别的影响,特别是在音频质量下降的情况下。他们的研究利用CREMA-D语料库,在各种面部线索条件下训练分类器,包括仅音频、带下部面部特征的音频、带上部面部特征的音频以及两者都带的音频。研究结果表明,虽然下部面部特征显著提高了在嘈杂音频中的鲁棒性,但上部面部情感线索有助于更好地校准和估计置信度,这表明表情丰富的面部信息在多模态交互系统中发挥着作用。

  6. TOOL · CL_18781 ·

    AI框架使用混合精度进行设备端双相激越检测

    研究人员开发了一个名为MP-IB的新框架,用于在语音数据中解耦稳定的说话者特征与不稳定的情感状态,专门用于资源受限设备上的双相情感障碍激越检测。该系统利用混合精度量化,其中不同的数值精度(特征使用FP16,状态使用INT4)创建信息瓶颈来分离这些元素。该方法在Bridge2AI-Voice数据集上达到了0.117的rho值,优于现有方法,并实现了具有小内存占用的实时监控。