研究人员正在探索使用大型语言模型(LLMs)来提高社交媒体平台内容审核的有效性和可扩展性。一项研究表明,少样本LLM方法在识别有害内容方面优于现有的专有基线和最先进的方法,即使在整合视觉信息时也是如此。另一项对11个数据集的53个模型的综合评估显示,虽然前沿模型在某些领域表现出色,但小型专业模型在其他领域更胜一筹,而现实世界中的对话安全仍然是一个重大挑战。另一项针对德国社交媒体的独立研究成功地使用LLM投票者集成,在检测各种有害内容方面取得了最佳性能,克服了类别不平衡问题。 AI
影响 基于LLM的内容审核在提高可扩展性和准确性方面具有潜力,但全面应对所有场景的安全挑战仍然存在。
排序理由 该集群包含三篇在arXiv上发表的学术论文,详细介绍了LLM在内容审核和基准安全场景中的应用研究。
- Afshin Oroojlooy
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- German
- GermEval 2026
- Gotit.pub
- Hugging Face
- large-language models
- OpenAI Moderation
- Philipp Steigerwald
- ScienceCast
- social media
AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →