研究人员引入了一种新颖的大语言模型(LLM)评估框架,该框架侧重于相对偏好而非绝对正确性。这种基于共识的方法使用一个由不同LLM组成的面板对同一提示的匿名响应进行排名,将模型间的总体一致性视为感知质量的代理。一项涉及五个最先进LLM跨越不同领域的研究揭示了持续的偏好模式,并促成了相对智能指数(RII)的开发。虽然这种方法为比较评估提供了一种可扩展的、由模型驱动的替代方案,但作者指出,它反映了模型间的偏好一致性,可能与人类判断不直接相关。 AI
影响 引入了一种新颖、可扩展的LLM比较评估方法,可能为模型对齐和感知质量提供见解。
排序理由 学术论文,介绍了一种新的LLM评估方法。 [lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →