PulseAugur
实时 07:41:13
实体 Shachar Don-Yehiya

Shachar Don-Yehiya

PulseAugur coverage of Shachar Don-Yehiya — every cluster mentioning Shachar Don-Yehiya across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_233483 ·

    研究发现,LLM评估锚点必须避免极端值,以获得可靠排名

    arXiv上的一篇新研究论文探讨了锚点选择在大型语言模型(LLM)评估中的关键作用。该研究在Arena-Hard-v2.0数据集上测试了22个不同的锚点,发现使用极端模型(表现最好或最差)作为锚点会显著降低与人类排名的相关性。研究人员认为,锚点选择的影响与裁判模型本身的选择相当。他们为选择更具信息量的锚点提供了建议,并指出当前的基准测试规模不足以可靠地评估具有竞争力的模型。