一个名为 FlavourBench 的新基准测试已被引入,使用一个可执行的烹饪系统作为事实依据来评估前沿语言模型。这个名为 Epicure 的系统为涉及配料选择和组成的任务提供了密集、可执行的分数。该基准测试评估了 27 个模型,涵盖 534 个任务,确保每个模型都有相同数量的有效响应,以消除因缺失率不同而产生的偏差。Grok 4.6 取得了最高分,在 351 个模型对中解决了 101 个。 AI
影响 引入了一种新颖的 LLM 评估方法,可能会影响未来的基准测试设计和模型开发。
排序理由 该集群描述了一篇介绍用于评估语言模型的新颖基准测试的学术论文。
在 Hugging Face Daily Papers 阅读 →
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Epicure
- FlavourBench
- Gotit.pub
- Grok 4.6
- Hugging Face
- Josef Liyanjun Chen
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →