PulseAugur
中
实时 11:02:52
实体 SummEval

SummEval

PulseAugur coverage of SummEval — every cluster mentioning SummEval across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
4
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
4
90 天内 4
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 4 条
  1. TOOL · CL_280285 ·

    研究发现,LLM裁判在评估难度上与人类存在差异

    一篇新发表在arXiv上的研究探讨了使用大型语言模型(LLMs)作为摘要评估裁判的应用。研究人员发现,尽管LLMs在总体评分上可能与人类一致,但它们并不一定认为相同的评估案例具有难度。这项使用Many-Facet Rasch模型对SummEval数据集进行的心理测量学分析表明,人类和LLM裁判在不同摘要维度上表现出不同的难度模式,在一致性评估中,LLMs倾向于“LLM难”的案例,而人类在连贯性评估中则偏好“人类难”的案例。

  2. TOOL · CL_247678 ·

    LLM作为裁判:口头置信度在新模型上优于对数概率

    一篇新的arXiv论文提出了一种转变,关于如何将大型语言模型(LLM)用作裁判,建议对于2025年后的专有模型,口头置信度已成为比对数概率更稳健的评分机制。研究表明,这种“兼容性转变”在SummEval、AggreFact和HelpSteer2等各种基准测试中显而易见,涉及多达18个LLM。该论文引入了过度自信咨询和自我辩论来改善校准和分数分布,并指出与旧模型不同,新模型能以最小的成本适应这些补充。

  3. TOOL · CL_65807 ·

    引入LLM裁判小组校准框架

    研究人员开发了一个名为有限校准小组选择(Finite-Calibration Panel Selection)的框架,用于确定LLM裁判小组的最佳校准策略。该方法根据可用的人工标注预算,帮助决定是使用低维堆叠器还是联合输出表。研究表明,对于许多当前的LLM输出,简单的标量聚合方法就足够了,但复杂的交互可能需要更复杂的联合表方法来进行准确评估。

  4. RESEARCH · CL_104763 ·

    新的大型语言模型评估方法解决对齐和偏见问题

    研究人员正在开发新的方法来评估和改进大型语言模型(LLMs)的对齐性和可解释性。Google Research 提出了一个框架,该框架改编了心理学评估方法,以量化 LLM 的行为倾向并将其与人类共识进行比较。同时,一种名为 BINEVAL 的新方法将评估标准分解为二元问题,提供了比传统 LLM 裁判更具可解释性和可调试性的分数。其他研究则探讨了如何减轻 LLM 评估者中的自我偏好偏见,并通过考虑项目难度来改进置信度校准。