研究人员开发了一种新的训练大型语言模型的方法,以减少长篇文本生成中的幻觉。该方法利用基于评分的奖励系统,该系统指定答案所需的和可选的信息,而不是依赖于更简单的全局丰富性代理。实验表明,基础、评分覆盖率和相关性奖励的平衡组合能产生最佳结果,从而提高分布内支持和分布外迁移。 AI
影响 引入了一种新颖的 LLM 训练方法,有望实现更可靠、信息更丰富的长篇文本生成。
排序理由 这是一篇发表在 arXiv 上的研究论文,详细介绍了一种新的 LLM 训练方法。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX Code Finder for Papers
- Connected Papers
- CORE Recommender
- DagsHub
- Gotit.pub
- Hugging Face
- Influence Flower
- Litmaps
- ScienceCast
- scite Smart Citations
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →