PulseAugur
实时 18:11:35
实体 SummEval

SummEval

PulseAugur coverage of SummEval — every cluster mentioning SummEval across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
  1. TOOL · CL_65807 ·

    引入LLM裁判小组校准框架

    研究人员开发了一个名为有限校准小组选择(Finite-Calibration Panel Selection)的框架,用于确定LLM裁判小组的最佳校准策略。该方法根据可用的人工标注预算,帮助决定是使用低维堆叠器还是联合输出表。研究表明,对于许多当前的LLM输出,简单的标量聚合方法就足够了,但复杂的交互可能需要更复杂的联合表方法来进行准确评估。

  2. RESEARCH · CL_104763 ·

    新的大型语言模型评估方法解决对齐和偏见问题

    研究人员正在开发新的方法来评估和改进大型语言模型(LLMs)的对齐性和可解释性。Google Research 提出了一个框架,该框架改编了心理学评估方法,以量化 LLM 的行为倾向并将其与人类共识进行比较。同时,一种名为 BINEVAL 的新方法将评估标准分解为二元问题,提供了比传统 LLM 裁判更具可解释性和可调试性的分数。其他研究则探讨了如何减轻 LLM 评估者中的自我偏好偏见,并通过考虑项目难度来改进置信度校准。