ChaosNLI
PulseAugur coverage of ChaosNLI — every cluster mentioning ChaosNLI across labs, papers, and developer communities, ranked by signal.
5 天有情绪数据
-
软标签训练通过使用完整的标注分布来提高分类器准确性
研究人员提出了一种名为软标签训练的新型监督分类器训练方法,该方法利用标注者标签的完整分布,而不是单一的多数投票。这种方法对于具有内在歧义的任务特别有益,例如自然语言推理或礼貌检测。跨三个数据集的实验表明,软标签训练的准确性可与硬标签相媲美或超越硬标签,显著减少与标注者分布的偏差,并产生反映人类分歧的不确定性模型。
-
NLI标签变异研究未能复制先前的发现
一项关于Stanford Natural Language Inference语料库、MultiNLI和ChaosNLI数据集的预注册复制研究未能证实先前关于人类标签变异的发现。最初的研究表明,具有非向上单调算子的假设将显示出较低的标签一致性。然而,本次复制研究发现情况恰恰相反,非向上项目表现出略高的同意率,并且所有观察到的效应均低于关注阈值。研究人员得出结论,先前确定的标签一致性中的负边界可能是重新标注资源中使用的选择方法的产物,而…
-
NLI标签变异研究未能复制先前关于单调性的发现
一项预注册的复制研究旨在验证先前在自然语言推理(NLI)任务中观察到的人类标签变异(HLV)边界。最初的研究表明,具有非向上单调算子的假设会导致较低的标签一致性。然而,这项在SNLI和MultiNLI开发集中的未选定人群中进行的复制未能证实这一发现。相反,该研究观察到非向上项目的同意率略高,所有效应量均低于关注阈值,这使得作者得出结论,原始边界可能取决于选择方法,而不是一般人群的属性。
-
形式语义结构在自然语言推断(NLI)任务中仅能解释极少的人类标签变异性
一篇新的研究论文探讨了形式语义结构在多大程度上解释了自然语言推断(NLI)任务中人类标签的变异性。该研究分析了来自 SNLI 和 MNLI 语料库的项目,发现具有不那么直接单调性的假设表现出更高的标签熵。然而,形式特征仅占熵方差的一小部分,表明它们不足以识别具有高标注者分歧的项目。研究还发现,语义结构并未显著改变标注者之间分歧的性质。
-
新研究发现温度缩放无法处理软标签
一项新的研究论文挑战了温度缩放方法在模型校准方面的有效性,尤其是在处理软标签或分布性人类标签时。研究发现,假设确定性独热标签的温度缩放方法,在直接对软标签进行校准的预言机(oracle)面前表现持续不佳。这种校准差距在语言模型中比在视觉模型中更大,并且随着模型规模的增大而增加。研究结果表明,在标签模糊性固有的安全关键应用中,当前的校准方法可能无法准确反映模型的可靠性。
-
Apple ML Research:标注需求因评估指标而异
Apple Machine Learning Research 发表了一篇论文,详细介绍了一种名为“Metric-Dependent Annotation Saturation”(依赖于指标的标注饱和度)的方法。该方法提出,从标签分布中捕获有意义信号所需的标注者数量取决于所使用的具体评估指标。例如,在自然语言推理(NLI)模型中,实现熵相关性收敛比实现分布匹配需要更多的标注者。研究还强调,软标签(代表细微的决策边界)比独热标签提供更好…
-
研究发现,AI模型的标注需求因评估指标而异
一篇新研究论文探讨了有效训练AI模型所需的标注者数量如何取决于所使用的具体评估指标。该研究聚焦于自然语言推断(NLI)模型,发现像熵相关性(entropy correlation)这样的指标需要更大的标注者池(20-50人)才能稳定,而像KL散度(KL divergence)这样的分布匹配指标则只需10名标注者即可收敛。这表明标注预算应根据预期的评估指标进行定制,而不是采用统一的方法。