研究人员推出Loong,一个开源框架,旨在为训练推理密集型领域的LLM生成和验证合成数据。该框架包括LoongBench,一个包含12个领域人工审核示例的数据集,以及LoongEnv,一个用于生成新的问答代码三元组的环境。该系统旨在克服可验证数据集有限和监督成本高昂的挑战,使LLM能够通过具有可验证奖励的强化学习来改进其链式思维(CoT)推理。 AI
影响 该框架可能显著降低训练LLM进行复杂推理任务的成本并扩大规模,从而可能带来更强大的AI系统。
排序理由 该集群包含一篇学术论文,详细介绍了用于LLM的合成数据生成和验证的新框架。[lever_c_demoted from research: ic=1 ai=1.0]
- Chain-of-Thought
- Large Language Models
- Loong
- LoongBench
- LoongEnv
- Reinforcement Learning with Verifiable Reward
- Xingyue Huang
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →