研究人员开发了一种新颖的推断性评估方法,用于评估在目标人群中缺乏黄金标准结果时,在代理标签上训练的模型。该方法解决了在协变量偏移(数据分布来源不同)下评估模型可靠性的挑战。所提出的交叉拟合估计器通过特定来源的密度比,利用标记的来源数据集和未标记的目标数据集的信息,从而能够对TPR、FPR和AUC等关键性能指标进行渐近推断。该方法通过模拟和在Chatbot Arena及ACS-Income数据上的回顾性研究进行了验证。 AI
影响 为在数据分布变化的现实场景中更可靠地部署AI模型提供了框架。
排序理由 该集群包含一篇详细介绍用于评估机器学习模型的新统计方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →