发布了一个新的基准测试,旨在取代旧的、不太相关的测试。该基准测试使用一个包含“马骑自行车,背景有骆驼”的提示词来评估各种语言模型。尽管提示词有拼写错误,但仍被用来比较 Qwen3.8-27b、Sol 5.6 和 Qwen3.6-35B 等模型。 AI
影响 与过时的测试相比,这个新基准可能提供了一种更相关的方式来评估语言模型的能力。
排序理由 该集群讨论了用于评估语言模型的新基准,属于研究范畴。
- Qwen3.6-35B
- Qwen3.8-27b medium
- Sol 5.6 high
- alpaca
- Claude 3
- EleutherAI
- GPT-4
- Hugging Face
- llama
- Llama 3
- Meta*
- Mistral AI
- OpenAI
- Qwen3.8-27b
- Sol 5.6
- Vicuña
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →