提出了一种新的人工智能基准污染分类法,该分类法按其挫败的缓解方法对污染类型进行组织。该分类法将污染分为直接型、派生型、时间型、分布型和习得型,并解决了训练时和评估时的数据泄露问题。研究还引入了一个四字段披露协议来报告污染状态,并承认“未知”是一个有效条目。对41份文件的分析显示,一些变量的编码者间可靠性较低,在变量适用时间上存在显著分歧,而不是在其陈述内容上存在分歧。 AI
影响 这项研究旨在提高人工智能基准报告的可靠性和透明度,从而可能更准确地评估模型能力。
排序理由 该集群包含一篇学术论文,详细介绍了人工智能基准污染的新分类法。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →