一项关于Stanford Natural Language Inference语料库、MultiNLI和ChaosNLI数据集的预注册复制研究未能证实先前关于人类标签变异的发现。最初的研究表明,具有非向上单调算子的假设将显示出较低的标签一致性。然而,本次复制研究发现情况恰恰相反,非向上项目表现出略高的同意率,并且所有观察到的效应均低于关注阈值。研究人员得出结论,先前确定的标签一致性中的负边界可能是重新标注资源中使用的选择方法的产物,而不是真正的人群级属性。 AI
影响 挑战了关于NLI数据集中人类标签变异的假设,可能影响未来的数据集创建和模型评估。
排序理由 学术论文,详细介绍了对先前研究结果的复制研究。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →