研究人员开发了一个名为监督道德理由注意力(SMRA)的新颖框架,以提高仇恨言论检测模型的可解释性和鲁棒性。与依赖表面线索或事后解释的先前方法不同,SMRA将源自道德基础理论的道德理由直接整合到训练目标中。这种方法指导模型关注文本中道德上显著的部分,从而产生更具上下文和内在可理解的解释。该框架使用巴西葡萄牙语的新基准数据集HateBRMoralXplain进行了验证,证明在不损害公平性的情况下提高了性能和解释质量。 AI
影响 增强了AI驱动的仇恨言论检测系统的可解释性和鲁棒性。
排序理由 该集群描述了一篇详细介绍AI研究新框架和数据集的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- Brazilian Portuguese
- CatalyzeX
- DagsHub
- Francielle Vargas
- Gotit.pub
- HateBRMoralXplain
- Hugging Face
- moral foundations theory
- ScienceCast
- Supervised Moral Rationale Attention
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →