研究人员开发了具有可验证奖励的强化学习(RLSVR),这是一种新的训练范式,将具有可验证奖励的强化学习(RLVR)的应用扩展到开放式任务。传统的RLVR仅限于数学和编码等易于验证正确性的领域。RLSVR将开放式任务转化为可验证的代理环境,利用SpyRL多智能体游戏等机制生成自动奖励信号。实验表明,这种方法在文本摘要和创意写作等任务上提高了性能,同时在可验证推理任务上也取得了进步。 AI
影响 使LLM在传统可验证领域之外的各种开放式任务中能够进行更具可扩展性的自我改进。
排序理由 该集群描述了一篇详细介绍LLM训练新方法的最新研究论文。
在 Mastodon — fosstodon.org 阅读 →
- automatic summarization
- creative writing
- mathematical reasoning
- RLSVR
- RLVR
- Who Is the Spy?
- Hugging Face
AI 生成摘要 · Google Gemini · 来自 5 个来源。 我们如何撰写摘要 →