研究人员推出MultiGhostBench,这是一个新的多语言基准,旨在评估长篇语言模型生成文本的归因。该基准包含六种语言的928本书籍,平均长度为59,000字,旨在测试在领域、作者和语言变化等各种分布变化下的归因能力。初步评估表明,当前的归因方法在这些变化下表现不佳,尽管基于Transformer的检测器显示出一定的跨语言能力。 AI
影响 该基准有望推动AI生成内容检测方面的进步,这对于打击虚假信息和维护学术诚信至关重要。
排序理由 该集群描述了一篇介绍用于研究目的的基准数据集的新学术论文。
在 arXiv cs.IR (Information Retrieval) 阅读 →
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- LLM
- MultiGhostBench
- ScienceCast
- Transformer++
- English
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →