研究人员推出了AVShift,这是一个新的基准测试,旨在评估作者身份验证(AV)模型在各种分布变化下的表现,包括体裁、时间和人工智能辅助写作。该基准测试是德语文本的同类首个测试,包含跨越三个体裁和21年的15万多对文本。使用AVShift进行的实验表明,经过微调的大型语言模型(LLM)在各种体裁中表现最佳,并受益于多样化的训练数据,而时间漂移对AV性能有显著影响。值得注意的是,该研究在AVShift数据集中未发现可衡量的AI时代分布变化。 AI
影响 该基准测试将有助于研究人员开发更强大的AI写作检测系统,以应对文本中的现实世界变化。
排序理由 该集群包含一篇介绍用于评估AI模型的新基准测试的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →