MultiNLI
PulseAugur coverage of MultiNLI — every cluster mentioning MultiNLI across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新框架通过失败模式老虎机提高 NLU 模型鲁棒性
研究人员开发了一种新颖的对抗性数据策展框架,旨在增强自然语言理解 (NLU) 模型的鲁棒性。该系统将数据策展构建为一个失败模式上下文老虎机问题,其中生成候选示例,由目标模型过滤,并由大型语言模型 (LLM) 集成进行验证。然后,该框架将这些示例聚类为反复出现的失败模式,并自适应地选择要采样的模式进行再训练,从而平衡鲁棒性提升与数据成本。该方法在 SNLI、ANLI 和 MultiNLI 等基准测试中显示出显著的准确性提升,并在事实核查…
-
NLI标签变异研究未能复制先前的发现
一项关于Stanford Natural Language Inference语料库、MultiNLI和ChaosNLI数据集的预注册复制研究未能证实先前关于人类标签变异的发现。最初的研究表明,具有非向上单调算子的假设将显示出较低的标签一致性。然而,本次复制研究发现情况恰恰相反,非向上项目表现出略高的同意率,并且所有观察到的效应均低于关注阈值。研究人员得出结论,先前确定的标签一致性中的负边界可能是重新标注资源中使用的选择方法的产物,而…
-
NLI标签变异研究未能复制先前关于单调性的发现
一项预注册的复制研究旨在验证先前在自然语言推理(NLI)任务中观察到的人类标签变异(HLV)边界。最初的研究表明,具有非向上单调算子的假设会导致较低的标签一致性。然而,这项在SNLI和MultiNLI开发集中的未选定人群中进行的复制未能证实这一发现。相反,该研究观察到非向上项目的同意率略高,所有效应量均低于关注阈值,这使得作者得出结论,原始边界可能取决于选择方法,而不是一般人群的属性。