PulseAugur
实时 06:52:07
实体 Speech Emotion Recognition Using Machine Learning

Speech Emotion Recognition Using Machine Learning

PulseAugur coverage of Speech Emotion Recognition Using Machine Learning — every cluster mentioning Speech Emotion Recognition Using Machine Learning across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 9
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 9
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 9 条
  1. TOOL · CL_235418 ·

    新框架增强语音匿名化能力,同时保留数据效用

    研究人员开发了一种新的两阶段语音匿名化框架,旨在保留语言内容和声学身份,同时维持数据效用。该框架使用生成式语音编辑模型替换个人身份信息,并采用一种名为 F3-VA 的新颖基于流匹配的方法来创建多样化的匿名说话人。提出的评估协议通过说话人验证指标评估隐私,并通过从头开始训练自动语音识别、文本到语音和语音情感识别的下游模型来评估效用,与现有方法相比,在隐私方面有所提高,效用损失最小。

  2. TOOL · CL_233433 ·

    新的TTS生成后门攻击利用语音情感识别系统

    研究人员发现了一种针对语音情感识别(SER)系统的新型后门攻击方法,该方法利用文本到语音(TTS)生成的音频。该技术将细微的声学触发器嵌入语音中,即使在低中毒率下也能以高成功率损害SER模型。研究发现,这些后门模式在不同模型之间具有可迁移性,并且自监督表示尤其容易受到攻击,这凸显了当前SER流程中存在的重大安全风险。

  3. TOOL · CL_187262 ·

    Whisper模型适配用于波斯语语音情感识别,并进行PCA降维

    研究人员探索了改进低资源语言(如波斯语)的语音情感识别(SER)的方法,重点关注Whisper模型。他们的研究提出使用主成分分析(PCA)来降低Whisper的帧级嵌入的维度,从而在不牺牲性能的情况下减少可训练参数和训练延迟。虽然基于PCA的降维一致地提高了情感识别的准确性,但对波斯语自动语音识别(ASR)任务进行微调Whisper仅对SER产生了微小改进,表明语言适配对情感特定表示的迁移能力有限。

  4. RESEARCH · CL_185168 ·

    HyPASE框架使用双曲几何进行高效LALM微调

    研究人员开发了HyPASE,一个利用双曲几何进行参数高效微调大型音频语言模型(LALMs)以用于语音情感识别(SER)的新型框架。与在欧几里得空间中操作的传统方法不同,HyPASE采用了Poincaré球模型来更好地捕捉情感线索的多粒度性。该框架包括一个双曲几何适配器(HGA)和一个情感感知多容量跨模态聚合器(EMCA),它们共同提高了在MELD和IEMOCAP等基准测试上的性能,尤其是在类别不平衡数据集上。这种方法为将LALMs适应…

  5. TOOL · CL_174366 ·

    新的AMRD方法赋能轻量级语音情感识别模型

    研究人员开发了一种新颖的自适应多教师关系蒸馏(AMRD)方法,用于创建适用于设备端应用的轻量级语音情感识别(SER)模型。AMRD通过根据教师模型的批次可靠性自适应加权,并结合关系蒸馏损失来捕获样本间的结构信息,从而解决了知识蒸馏中的挑战。在IEMOCAP和CREMA-D数据集上的实验表明,AMRD在各种学生模型架构上均优于传统的单教师蒸馏基线。

  6. RESEARCH · CL_154189 ·

    新的深度学习模型提高了语音情感识别的准确性和可解释性

    研究人员开发了用于语音情感识别(SER)的新深度学习技术,该领域对于推进人机交互至关重要。一项研究介绍了一种混合DCRF-BiLSTM模型,该模型在多个数据集上均取得了高准确率,包括对五个组合数据集的全新综合评估。另一篇论文提出了一种可解释且轻量级的紧凑型卷积神经网络,该网络通过Grad-CAM可视化有影响力的区域,平衡了识别性能与透明度和效率。

  7. RESEARCH · CL_109509 ·

    新的SpeechEQ基准测试评估语音模型中的AI情商

    研究人员推出SpeechEQ,一个旨在评估语音语言模型(SLM)情商的新框架。该框架包含一个包含2,265个对话的数据集和一个多轮评估协议,用于衡量口语情商(SEQ),其灵感来源于人类情商评估。使用SpeechEQ进行的实验揭示,当前的模态多样的模型在语用线索方面存在困难,表现出模态捷径、安全陷阱和上下文遗忘等问题,表明在实现真正具有情感意识的AI方面存在重大障碍。

  8. RESEARCH · CL_79160 ·

    新的适配器为音频大语言模型添加测试时记忆,以改善情感识别

    研究人员开发了一种名为 Titans-as-a-Layer (MAL) 的新方法,以增强对话语音情感识别。这种即插即用的适配器将测试时神经网络记忆集成到大型音频语言模型中,而无需改变其核心结构。MAL 适配器将对话历史写入小型内存中,并利用其提供上下文更新,显著提高了在各种指标和数据集上的 SER 性能。

  9. RESEARCH · CL_76796 ·

    音频语言模型通过声学线索改进语音情感识别

    研究人员开发了一种通过整合明确的声学线索来改进音频语言模型中语音情感识别的方法。通过从副语言特征中提取六个可解释的声学概念标记,他们发现将这些标记与音频输入对齐可以提高模型性能。相反,错位或损坏的标记会降低准确性,这表明模型对符号线索通道敏感,同时保留了一些音频信号基础。