PulseAugur
实时 09:57:54
实体 BFF-Bench

BFF-Bench

PulseAugur coverage of BFF-Bench — every cluster mentioning BFF-Bench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_196088 ·

    研究发现:LLM作为裁判的评估在缺乏人类依据时存在缺陷

    一篇题为“没有免费标签:LLM作为裁判在缺乏人类依据时的局限性”的新研究论文,重点指出了使用大型语言模型(LLMs)评估其他LLMs时存在的重大局限性,尤其是在需要事实准确性的领域。该研究引入了商业和金融基础知识基准(BFF-Bench),这是一个包含160个问题和专家评估答案的数据集。研究结果表明,只有当LLM裁判自己能够正确回答问题时,它们与人类专家的意见才高度一致。为LLM裁判提供专家撰写的参考资料在很大程度上缓解了这个问题,这…