PulseAugur
实时 14:43:34
English(EN) Self-Explaining Hate Speech Detection with Moral Rationales

新的AI框架通过道德理由增强仇恨言论检测

研究人员开发了一个名为监督道德理由注意力(SMRA)的新颖框架,以提高仇恨言论检测模型的可解释性和鲁棒性。与依赖表面线索或事后解释的先前方法不同,SMRA将源自道德基础理论的道德理由直接整合到训练目标中。这种方法指导模型关注文本中道德上显著的部分,从而产生更具上下文和内在可理解的解释。该框架使用巴西葡萄牙语的新基准数据集HateBRMoralXplain进行了验证,证明在不损害公平性的情况下提高了性能和解释质量。 AI

影响 增强了AI驱动的仇恨言论检测系统的可解释性和鲁棒性。

排序理由 该集群描述了一篇详细介绍AI研究新框架和数据集的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的AI框架通过道德理由增强仇恨言论检测

报道来源 [1]

  1. arXiv cs.CL TIER_1 English(EN) · Francielle Vargas, Jackson Trager, Diego Alves, Surendrabikram Thapa, Matteo Guida, Berk Atil, Daryna Dementieva, Andrew Smart, Ameeta Agrawal ·

    具有道德理由的自解释仇恨言论检测

    arXiv:2601.03481v2 Announce Type: replace Abstract: Existing hate speech detection models are often opaque and rely on surface-level lexical cues, which makes them vulnerable to spurious correlations and limits robustness, interpretability and cultural contextualization. We propo…