Stanford Natural Language Inference corpus
PulseAugur coverage of Stanford Natural Language Inference corpus — every cluster mentioning Stanford Natural Language Inference corpus across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新框架通过失败模式老虎机提高 NLU 模型鲁棒性
研究人员开发了一种新颖的对抗性数据策展框架,旨在增强自然语言理解 (NLU) 模型的鲁棒性。该系统将数据策展构建为一个失败模式上下文老虎机问题,其中生成候选示例,由目标模型过滤,并由大型语言模型 (LLM) 集成进行验证。然后,该框架将这些示例聚类为反复出现的失败模式,并自适应地选择要采样的模式进行再训练,从而平衡鲁棒性提升与数据成本。该方法在 SNLI、ANLI 和 MultiNLI 等基准测试中显示出显著的准确性提升,并在事实核查…
-
新方法为NLI任务生成常识公理,提高LLM准确性
研究人员开发了一种为自然语言推理(NLI)任务生成常识知识公理的方法,并使用 Llama 3.1 70B 和 GPT-OSS 120B 等LLM评估了其有效性。引入了一种新颖的无参考LLM作为裁判框架来评估这些生成公理的事实性,揭示了模型之间显著的性能差异。一种选择性整合高度事实性公理的混合方法在SNLI和ANLI基准测试中展示了持续的准确性提升,性能提高了高达8.5%,并帮助模型克服了偏见。
-
NLI标签变异研究未能复制先前的发现
一项关于Stanford Natural Language Inference语料库、MultiNLI和ChaosNLI数据集的预注册复制研究未能证实先前关于人类标签变异的发现。最初的研究表明,具有非向上单调算子的假设将显示出较低的标签一致性。然而,本次复制研究发现情况恰恰相反,非向上项目表现出略高的同意率,并且所有观察到的效应均低于关注阈值。研究人员得出结论,先前确定的标签一致性中的负边界可能是重新标注资源中使用的选择方法的产物,而…
-
NLI标签变异研究未能复制先前关于单调性的发现
一项预注册的复制研究旨在验证先前在自然语言推理(NLI)任务中观察到的人类标签变异(HLV)边界。最初的研究表明,具有非向上单调算子的假设会导致较低的标签一致性。然而,这项在SNLI和MultiNLI开发集中的未选定人群中进行的复制未能证实这一发现。相反,该研究观察到非向上项目的同意率略高,所有效应量均低于关注阈值,这使得作者得出结论,原始边界可能取决于选择方法,而不是一般人群的属性。
-
形式语义结构在自然语言推断(NLI)任务中仅能解释极少的人类标签变异性
一篇新的研究论文探讨了形式语义结构在多大程度上解释了自然语言推断(NLI)任务中人类标签的变异性。该研究分析了来自 SNLI 和 MNLI 语料库的项目,发现具有不那么直接单调性的假设表现出更高的标签熵。然而,形式特征仅占熵方差的一小部分,表明它们不足以识别具有高标注者分歧的项目。研究还发现,语义结构并未显著改变标注者之间分歧的性质。
-
新研究发现温度缩放无法处理软标签
一项新的研究论文挑战了温度缩放方法在模型校准方面的有效性,尤其是在处理软标签或分布性人类标签时。研究发现,假设确定性独热标签的温度缩放方法,在直接对软标签进行校准的预言机(oracle)面前表现持续不佳。这种校准差距在语言模型中比在视觉模型中更大,并且随着模型规模的增大而增加。研究结果表明,在标签模糊性固有的安全关键应用中,当前的校准方法可能无法准确反映模型的可靠性。
-
新的审计协议测试NLP基准的证据依赖性
研究人员为自然语言处理中的弱标签基准开发了一种新的审计协议。该协议区分了仅凭元数据即可预测的输出与真正依赖于所提供证据的输出。通过结合元数据先验主导得分和证据干预统计量,该方法旨在提供对基准可靠性更稳健的评估。