Speech Emotion Recognition Using Machine Learning
PulseAugur coverage of Speech Emotion Recognition Using Machine Learning — every cluster mentioning Speech Emotion Recognition Using Machine Learning across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新型轻量级模型增强了语音情感识别的可解释性
研究人员开发了一个新的语音情感识别(SER)框架,该框架同时注重准确性和透明度。这种轻量级深度学习模型使用紧凑型卷积神经网络和对数梅尔频谱图来分析语音特征。为了增强可解释性,该系统集成了Grad-CAM来可视化音频信号的哪些部分影响了其预测。在SAVEE数据集上的评估表明,该模型比现有的SER模型拥有更少的参数,却能达到具有竞争力的性能,在准确性、效率和透明度之间提供了实用的平衡。
-
新的SpeechEQ基准测试评估语音模型中的AI情商
研究人员推出SpeechEQ,一个旨在评估语音语言模型(SLM)情商的新框架。该框架包含一个包含2,265个对话的数据集和一个多轮评估协议,用于衡量口语情商(SEQ),其灵感来源于人类情商评估。使用SpeechEQ进行的实验揭示,当前的模态多样的模型在语用线索方面存在困难,表现出模态捷径、安全陷阱和上下文遗忘等问题,表明在实现真正具有情感意识的AI方面存在重大障碍。
-
新的适配器为音频大语言模型添加测试时记忆,以改善情感识别
研究人员开发了一种名为 Titans-as-a-Layer (MAL) 的新方法,以增强对话语音情感识别。这种即插即用的适配器将测试时神经网络记忆集成到大型音频语言模型中,而无需改变其核心结构。MAL 适配器将对话历史写入小型内存中,并利用其提供上下文更新,显著提高了在各种指标和数据集上的 SER 性能。
-
音频语言模型通过声学线索改进语音情感识别
研究人员开发了一种通过整合明确的声学线索来改进音频语言模型中语音情感识别的方法。通过从副语言特征中提取六个可解释的声学概念标记,他们发现将这些标记与音频输入对齐可以提高模型性能。相反,错位或损坏的标记会降低准确性,这表明模型对符号线索通道敏感,同时保留了一些音频信号基础。