由Frontier开发的新基准测试旨在通过避免导致现有排行榜分数虚高的“基准测试作弊”来提供对大型语言模型更客观的评估。这个新基准测试包含多样化的任务集,并且设计上能够抵制作弊。早期结果显示,像OpenAI的GPT-4和Anthropic的Claude 3 Opus这样的模型在该新指标上的表现与传统基准测试不同,一些模型的性能显著下降。 AI
影响 这个新基准测试可能导致对LLM能力的评估更加准确,并迫使开发者改进底层模型性能,而不是仅仅关注基准测试分数。
排序理由 该集群讨论了用于评估LLM的新基准测试,这是一个面向研究的主题。
- Claude 3 Opus
- Gemini 1.5 Pro
- GPT-4
- Hugging Face
- Llama 3
- Meta*
- Mistral AI
- Mixtral 8x22B
- OpenAI
- Open LLM Leaderboard
- Frontier
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →