Open LLM排行榜,一个用于评估大型语言模型的流行基准,因其方法论而受到批评。文章认为,在小型数据集上名列前茅的模型,例如来自OpenAI、Google和Meta的模型,在更大、更现实的数据集上不一定表现得一样好。梯度提升模型,一种更传统的机器学习技术,在完整数据集上与这些先进的LLM相比具有竞争力,但计算成本却显著降低。 AI
影响 质疑排名靠前的LLM的实际部署价值,表明传统方法可能更有效。
排序理由 文章批评了一个广泛使用的AI基准的方法论和影响。
- Claude 3 Opus
- Gemini
- GPT-4
- Hugging Face
- Llama 3
- Meta*
- Mistral AI
- Mixtral 8x22B
- OpenAI
- Open LLM Leaderboard
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →