研究人员开发了GenRubric,一个旨在自动生成大语言模型(LLMs)评估评分标准的新框架。这个自演化系统在演化过程中无需额外的人工标注,即可从无标签查询中改进评分标准的生成。GenRubric利用强化学习和评分标准诱导的自洽性原则,创建能够跨领域泛化的全面评分标准,从而提高大语言模型评估的可扩展性和可审计性。 AI
影响 通过自动化评分标准生成,提高了大语言模型评估的可扩展性和可审计性。
排序理由 这是一篇详细介绍大语言模型评估新框架的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- Connected Papers
- CORE Recommender
- DagsHub
- GenRubric
- Gotit.pub
- Hugging Face
- Litmaps
- ScienceCast
- scite Smart Citations
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →