一篇新的研究论文介绍LLMPEDIA,一个旨在衡量和浏览大型语言模型中嵌入的百科全书知识的系统。LLMPEDIA从GPT-5 mini、DeepSeek V3.2和Llama 3.3 70B等模型的参数化内存中递归提取约130万篇文章。然后,该系统根据维基百科和其他网络来源验证其中一部分声明,将其归类为支持、否定或信息不足。研究结果表明,在更广泛的知识集上,LLM的真实事实率为68.4%,远低于基准分数,并且有相当一部分声明无法解决。 AI
影响 这项研究突显了LLM在基准测试表现与现实世界事实准确性之间存在的显著差距,表明需要更强大的评估方法。
排序理由 该集群是一篇研究论文,详细介绍了一种新的LLM知识评估方法和系统。[lever_c_demoted from research: ic=1 ai=1.0]
- DeepSeek V3.2
- GPT-5 mini
- GPTKB
- Hendrycks et al.
- Hu et al.
- Llama 3.3 70B Instruct
- LLMPEDIA
- Massive Multitask Language Understanding
- Saeed and Razniewski
- Wikipedia
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →