一篇新发表在arXiv上的论文批评了自然语言生成(NLG)系统的标准人类评估协议。作者认为,常见的做法,特别是使用李克特量表,可能导致对人类偏好的评估不准确,甚至会颠倒真实的偏好方向。他们提出了一种名为系统级概率评估(SPA)的替代方法,用于评估故事生成等开放式任务,并证明了其在正确排序GPT-3模型大小方面的有效性。 AI
影响 提出了一种新的评估协议,可能导致对NLG模型能力进行更准确的评估。
排序理由 发表在arXiv上的研究论文,详细介绍了NLG模型的新评估协议。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →