一项新研究调查了AI偏好推断的可靠性,发现用于引发模型偏好的不同评估工具会产生显著不同的结果。研究人员使用五种不同的提示格式,对八个模型进行了15项与模型福利相关的结果测试。研究发现,跨评估工具的模型排名具有较低的0.348的泛化系数,这表明从一个评估工具获得的偏好对于另一个评估工具会报告什么信息量很小。这表明,测得的AI偏好中很大一部分可能归因于评估工具本身,而不是模型本身。 AI
影响 强调了当前评估AI模型福利方法的不可靠性,表明需要更强大和标准化的评估工具。
排序理由 该集群包含一篇学术论文,详细介绍了关于AI模型福利研究的新研究。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →