一项新的研究论文挑战了温度缩放方法在模型校准方面的有效性,尤其是在处理软标签或分布性人类标签时。研究发现,假设确定性独热标签的温度缩放方法,在直接对软标签进行校准的预言机(oracle)面前表现持续不佳。这种校准差距在语言模型中比在视觉模型中更大,并且随着模型规模的增大而增加。研究结果表明,在标签模糊性固有的安全关键应用中,当前的校准方法可能无法准确反映模型的可靠性。 AI
影响 基于多数投票标签构建的校准协议可能在安全关键环境中系统性地错误评估模型可靠性。
排序理由 关于模型校准方法的学术论文。
- Brier score
- ChaosNLI
- CIFAR-10H
- Hugging Face
- multiclass isotonic regression
- Stanford Natural Language Inference corpus
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →