AffectNet
PulseAugur coverage of AffectNet — every cluster mentioning AffectNet across labs, papers, and developer communities, ranked by signal.
-
研究发现:面部表情识别模型存在显著偏见
一项发表在arXiv上的新研究审视了面部表情识别(FER)数据集和模型中的偏见,发现分析的四个常用数据集均存在显著的人口统计学偏见,尤其是在种族方面。研究还评估了七种深度学习模型,结果显示,尽管像ViT和CLIP这样的Transformer模型通常能达到高精度,但它们也表现出最大的偏见。相反,像ResNet和XceptionNet这样的基于残差的CNN架构则显示出较低的偏见水平。研究结果强调,高精度并不等同于公平性,解决偏见需要同时兼…
-
新方法通过共享潜在空间和集成技术推进多任务面部情感识别 · 跟踪3个来源
研究人员开发了多任务面部情感识别的新方法,解决了部分标记数据集和类别不平衡等挑战。一种方法利用共享潜在空间来协调不同的面部分析任务,提高了表情识别和动作单元检测的性能。另一种技术,Strength-Parity Ensembling,专注于选择多样化且准确的专家来进行联合效价-唤醒度、表情和动作单元预测。第三个系统,AffectFuse,采用后编码器适应和跨任务特征融合以及时间建模,在情感行为分析方面取得了优异的成果。
-
新的LaCoVL-FER网络通过地标引导改进面部表情识别
研究人员开发了LaCoVL-FER,一个专为应对真实世界挑战性条件下的面部表情识别(FER)而设计的新型网络。该系统采用地标引导的自适应编码器,通过整合面部地标几何信息来优化视觉特征,从而减少噪声并增强与表情相关的表示。此外,视觉语言增强策略能够适应CLIP等预训练模型,生成实例特定的视觉和文本表示,提高鲁棒性和泛化能力。在RAF-DB、FERPlus和AffectNet等基准数据集上的实验表明,LaCoVL-FER的性能优于现有的最先进方法。
-
AI系统在视频分析中提升矛盾和犹豫识别能力 · 跟踪8个来源
研究人员开发了识别视频中矛盾和犹豫的先进方法,参加了第11届ABAW挑战赛。其中一种方法,HSEmotion团队的系统,利用多任务学习,结合冻结的轻量级面部提取器和后处理技术来预测效价、唤醒度、面部表情和动作单元。另一个系统SVF-CR采用同步视觉-面部交叉精炼框架进行多模态证据融合。第三种方法侧重于简单特征和诚实校准,引入“ASR擦除时间”来捕捉犹豫停顿,并使用称为情感标记融合的可靠性门控。
-
AI模型编码罗素情感模型,但稀有类别带来几何挑战
两篇新的arXiv论文探讨了AI模型中情感表示的几何特性。第一篇论文证明了多模态Transformer可以与罗素的情感环模型完美对齐,表明该模型的结构已内在地编码在嵌入中。第二篇论文认为,稀有类别情感识别的失败是由于这些类别在环模型上的几何退化,而非简单的类别不平衡,并提出需要新的表示方法来区分这些情感。
-
新网络利用地标和视觉语言模型增强人脸表情识别
研究人员开发了一个名为 LaCoVL-FER 的新网络,以改进人脸表情识别,尤其是在具有挑战性的真实世界条件下。该模型将面部地标的几何信息与像 CLIP 这样的视觉语言模型的语义理解相结合。该方法使用地标引导编码器进行自适应特征融合,并采用视觉语言增强策略来优化视觉表示和调整文本提示,从而实现更鲁棒和泛化的表情识别。