研究人员开发了一种名为LURE的新方法,用于在没有人类标注数据集的情况下训练大型语言模型(LLM)进行推理任务。该方法将训练过程构建为一场追逐-逃避游戏,其中一个LLM逃避者策略性地创建不同难度的任务,而一个LLM追逐者则尝试解决它们。该系统学会将任务设置在求解器成功率约为一半的难度级别,以优化“捕获前沿”奖励。与多个推理环境和LLM架构中的现有基线相比,该技术表现出优越的性能,实现了更强的分布外零样本准确率。 AI
影响 引入了一种新颖的LLM推理自玩训练范式,可能减少对人类标注数据的依赖。
排序理由 这是一篇详细介绍LLM训练新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- Connected Papers
- CORE Recommender
- DagsHub
- Gotit.pub
- Hugging Face
- Influence Flower
- Litmaps
- LLM
- LURE
- ScienceCast
- scite Smart Citations
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →