PulseAugur
中
实时 00:00:17
实体 FlavourBench

FlavourBench

PulseAugur coverage of FlavourBench — every cluster mentioning FlavourBench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 1 条
  1. RESEARCH · CL_215864 ·

    FlavourBench 基准测试使用烹饪任务对语言模型进行排名 · 跟踪 2 个来源

    一个名为 FlavourBench 的新基准测试已被引入,使用一个可执行的烹饪系统作为事实依据来评估前沿语言模型。这个名为 Epicure 的系统为涉及配料选择和组成的任务提供了密集、可执行的分数。该基准测试评估了 27 个模型,涵盖 534 个任务,确保每个模型都有相同数量的有效响应,以消除因缺失率不同而产生的偏差。Grok 4.6 取得了最高分,在 351 个模型对中解决了 101 个。