arXiv上的一篇新论文研究了大型语言模型中的基准测试污染,区分了分数膨胀和排行榜重排。研究发现,虽然污染确实会推高绝对分数,但很少改变模型在排行榜上的排名。该研究提出了一种通过比较原始测试项目和释义版本来审计污染的方法,并建议排行榜应报告释义控制的排名以及置信区间。 AI
影响 提供了一种审计LLM基准测试污染的方法,提高了模型评估的可靠性。
排序理由 研究论文分析LLM基准测试污染。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX Code Finder for Papers
- Connected Papers
- DagsHub
- Gotit.pub
- GSM8K
- HellaSwag
- Hugging Face
- Influence Flower
- Litmaps
- Massive Multitask Language Understanding
- ScienceCast
- scite Smart Citations
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →