Lukas Gehring等研究人员的一篇新论文探讨了当前大型语言模型(LLM)文本检测器在教育环境中的局限性。研究强调,这些检测器在区分人类写作文本和不同程度AI辅助生成的文本时,常常无法准确区分,尤其是在中等贡献水平下。为解决此问题,研究人员提出了一个贡献感知评估框架,并引入了GEDE,一个包含超过12,500篇生成论文的新基准数据集,以更好地模拟现实中的人机协作场景,并评估不同策略和模型下的检测系统。 AI
影响 由于无法准确分类AI辅助写作,当前的LLM文本检测器不适合可靠地执行学术诚信政策。
排序理由 该集群包含一篇研究论文,详细介绍了用于教育领域LLM文本检测的新评估框架和基准数据集。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Generative Essay Detection in Education
- Gotit.pub
- Hugging Face
- Large Language Models
- Lukas Gehring
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →