实体
Stanford Natural Language Inference corpus
Stanford Natural Language Inference corpus
PulseAugur coverage of Stanford Natural Language Inference corpus — every cluster mentioning Stanford Natural Language Inference corpus across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天
2 天有情绪数据
最近 · 第 1/1 页 · 共 3 条
-
形式语义结构在自然语言推断(NLI)任务中仅能解释极少的人类标签变异性
一篇新的研究论文探讨了形式语义结构在多大程度上解释了自然语言推断(NLI)任务中人类标签的变异性。该研究分析了来自 SNLI 和 MNLI 语料库的项目,发现具有不那么直接单调性的假设表现出更高的标签熵。然而,形式特征仅占熵方差的一小部分,表明它们不足以识别具有高标注者分歧的项目。研究还发现,语义结构并未显著改变标注者之间分歧的性质。
-
新研究发现温度缩放无法处理软标签
一项新的研究论文挑战了温度缩放方法在模型校准方面的有效性,尤其是在处理软标签或分布性人类标签时。研究发现,假设确定性独热标签的温度缩放方法,在直接对软标签进行校准的预言机(oracle)面前表现持续不佳。这种校准差距在语言模型中比在视觉模型中更大,并且随着模型规模的增大而增加。研究结果表明,在标签模糊性固有的安全关键应用中,当前的校准方法可能无法准确反映模型的可靠性。
-
新的审计协议测试NLP基准的证据依赖性
研究人员为自然语言处理中的弱标签基准开发了一种新的审计协议。该协议区分了仅凭元数据即可预测的输出与真正依赖于所提供证据的输出。通过结合元数据先验主导得分和证据干预统计量,该方法旨在提供对基准可靠性更稳健的评估。