研究人员开发了一种新的评估大型语言模型(LLM)的方法,该方法将计算机化自适应测试(CAT)的原理应用于连续评分指标。这种方法在最近的一篇arXiv论文中有所详细介绍,它用异方差正态分布取代了传统的伯努利分布,以处理ROUGE、BLEU和LLM-as-a-Judge等分数。所提出的具有自适应停止标准的、考虑不确定性的排名器旨在以显著更少的项目和更低的成本实现可靠的模型排名,在一次校准后,在自信预测上保持99%的准确率,同时在排名相关性上比随机抽样提高了0.13 $\tau$。 AI
影响 这项研究可能导致更高效、更具成本效益的LLM评估,从而可能加速模型开发和比较。
排序理由 该集群包含一篇关于LLM评估新方法的学术论文。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →