研究人员推出了一种新颖的基准测试Metanym Game,旨在评估大型语言模型(LLM)的结构智能。该游戏作为一个自包含、自一致的系统运行,LLM通过创建和评价彼此的词语类比来进行竞争。提出了一种使用奇异值分解的独特谱解法,用于同时评估LLM的事实准确性和判断能力,而无需依赖预定义的数据集。该基准测试的设计旨在抵抗训练数据污染,并且其代码和数据是公开可用的。 AI
影响 引入了一种评估LLM结构智能和事实准确性的新颖方法,可能为现有基准测试提供更强大的替代方案。
排序理由 该集群包含一篇详细介绍LLM新基准测试的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →