PulseAugur
实时 21:59:15
English(EN) SpEmoC: A Balanced Speaker-Segment Multimodal Emotion Benchmark

新的SpEmoC数据集旨在实现平衡的多模态情感识别

研究人员推出SpEmoC,一个用于口语对话中多模态情感识别的新基准数据集。该数据集包含来自电影和电视剧的超过30万个片段,其中一个精选的3万个高质量片段包含同步的视觉、音频和文本模态。SpEmoC旨在通过提供七种情感的平衡分布(包括恐惧和厌恶等少数类别),并采用严格的数据划分以确保模型泛化能力的可靠评估,来解决现有数据集的局限性。 AI

影响 该数据集有望提高AI模型在各种应用中理解人类情感的鲁棒性和泛化能力。

排序理由 该条目描述了一个在arXiv上发布的新学术数据集和多模态情感识别基准。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的SpEmoC数据集旨在实现平衡的多模态情感识别

报道来源 [1]

  1. arXiv cs.CV TIER_1 English(EN) · Sania Bano, Shahzad Ahmad, Santosh Kumar Vipparthi, Sukalpa Chanda, Subrahmanyam Murala ·

    SpEmoC:一个平衡的说话人-片段多模态情感基准

    arXiv:2607.18109v1 Announce Type: new Abstract: Understanding human emotions in spoken conversations is a key challenge in affective computing, with applications in empathetic AI, human computer interaction, and mental health monitoring. However, existing datasets vary in scale, …