研究人员正在探索先进方法以提高AI检测仇恨言论的能力,特别是在多语言和多模态的背景下。一项研究侧重于训练时可解释性,以使AI推理与人类的理由保持一致,从而提高在英语和Hinglish语中检测反穆斯林仇恨言论的准确性和可解释性。另一篇论文定性分析了LLaVA-7B、Qwen-VL、GPT-4o mini和Claude 3 Haiku等最先进的视觉语言模型在识别梗图中的仇恨言论方面的有效性,超越了简单的准确性评估,以评估它们的理由。第三项研究调查了LLM在乌尔都语仇恨言论检测中的跨脚本安全不一致性,揭示了原始脚本和英文翻译之间显著的标签不稳定性,并指出了当前该语言安全评估中的不足。 AI
影响 多语言和多模态仇恨言论检测的进步可能带来更细致、更具文化意识的内容审核系统。
排序理由 该集群包含多篇在arXiv上发表的学术论文,详细介绍了AI安全和模型在仇恨言论检测方面的能力研究。
- arXiv
- LoRA
- Roman Urdu
- Claude Sonnet 4.5
- Gemini 2.5 Flash
- GPT-4o
- Llama-3.1
- Qwen-2.5
- Urdu
- BullySent
- Claude 3 Haiku
- GPT-4o mini
- Grad X Input
- HateXplain
- Integrated Gradients
- LLaVA-7B
- Qwen VL
AI 生成摘要 · Google Gemini · 来自 4 个来源。 我们如何撰写摘要 →