研究人员开发了CANDOR,这是一种新的不一致性度量,旨在更准确地评估冻结基础编码器的能力。与以前的方法不同,CANDOR使用对称、等大的银行将机会水平固定在精确的50%,纠正了由发现的不平等流行度引入的偏差。通过在22个编码器和来自不同领域的605,443张图像上进行广泛测试,CANDOR显示,虽然没有编码器是完全盲目的,但所有编码器在辨别特定发现方面都表现出弱点,其性能通常低于预期。 AI
影响 这项研究可能导致对现有AI模型的更准确评估,指导未来的开发和部署。
排序理由 该集群包含一篇详细介绍评估AI模型新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →