一项新研究调查了大语言模型作为评委(LLMaJ)框架在自然语言生成(NLG)评估中的有效性。研究人员发现,与不进行分解的基线相比,没有证据表明将评估任务分解为子任务可以提高LLMaJ的性能。研究表明,先前观察到的分解带来的收益是由于使用了人类标签进行训练,而不是分解本身。此外,当人类标签可用时,不进行任务分解的LLMaJ可以达到与人类标注者相当的性能。 AI
影响 这项研究表明,当前大语言模型的评估方法可能无法从任务分解中受益,这可能会简化未来的评估框架。
排序理由 该集群包含一篇详细介绍大语言模型评估方法研究结果的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- LLM-as-a-Judge
- natural language generation
- ScienceCast
- Sebastian Steindl
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →