PulseAugur
实时 09:16:29
English(EN) Cost-Efficient Estimation of General Abilities Across Benchmarks

新的IRT模型以85%的成本降低高效预测LLM能力

研究人员开发了一种评估大型语言模型(LLM)的高效成本方法,通过预测它们在未见过任务上的表现。该方法利用了改进的多维度项目反应理论(IRT)模型结合自适应项目选择。该方法在65个模型和超过100,000个项目的数据集上进行了测试,在仅观察到16个项目后,即可预测在保留基准上的表现,平均绝对误差小于7%。此外,通过纳入成本感知因素,评估成本可降低高达85%。 AI

影响 这项研究提供了一种更高效、更具成本效益的基准测试LLM的方法,可能加速模型开发和比较。

排序理由 该集群包含一篇详细介绍LLM评估新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的IRT模型以85%的成本降低高效预测LLM能力

报道来源 [1]

  1. arXiv cs.CL TIER_1 English(EN) · Michael Krumdick, Adam Wiemerslage, Seth Ebner, Charles Lovering, Chris Tanner ·

    跨基准通用能力的高效成本估算

    arXiv:2604.01418v2 Announce Type: replace Abstract: Thousands of diverse benchmarks have been developed to measure the quality of large language models (LLMs). Yet prior work has demonstrated that LLM performance is often sufficiently explained by a small set of latent factors, o…