研究人员推出了Grounded Integration Measure (GIM),这是一个新的基准,旨在通过评估大型语言模型(LLM)整合多种认知运算的能力来对其进行评估。与仅关注知识回忆或抽象推理的基准不同,GIM提出的问题需要对约束满足和受众校准等技能与可访问知识进行协调。该基准包含820个原创问题,研究人员使用IRT模型和多位评审员开发了一个强大的评估框架来估算模型能力。他们的研究分析了22个模型和203,800个提示-评审员单元格,还研究了测试时间计算与模型性能之间的权衡,发现模型内部的配置选择对结果有显著影响。 AI
影响 这个新基准可能会导致对LLM能力的更细致的评估,推动其发展朝着更好地整合认知功能而非仅仅知识回忆的方向发展。
排序理由 该集群描述了一篇介绍用于评估LLM的新型基准的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →