研究人员开发了一个新的框架,使用大型语言模型(LLM)来评估多模态对话中的情感。该方法将声学线索纳入自然语言描述,并基于SpeechCueLLM方法。使用LLaMA、GPT和Qwen系列模型进行的实验表明,经过微调的LLaMA模型即使规模较小,也比经过提示工程的GPT模型表现更优。最佳模型在Valence评估方面创下了IEMOCAP数据集的新SOTA,达到了0.7822的一致性相关系数(CCC)。 AI
影响 在多模态情感识别基准测试中设定了新的SOTA,表明使用领域特定数据微调较小模型可以优于更大、通用的模型。
排序理由 详细介绍多模态对话情感评估新框架和基准结果的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →