研究人员开发了一种评估大型语言模型(LLM)的高效成本方法,通过预测它们在未见过任务上的表现。该方法利用了改进的多维度项目反应理论(IRT)模型结合自适应项目选择。该方法在65个模型和超过100,000个项目的数据集上进行了测试,在仅观察到16个项目后,即可预测在保留基准上的表现,平均绝对误差小于7%。此外,通过纳入成本感知因素,评估成本可降低高达85%。 AI
影响 这项研究提供了一种更高效、更具成本效益的基准测试LLM的方法,可能加速模型开发和比较。
排序理由 该集群包含一篇详细介绍LLM评估新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →