PulseAugur
实时 00:40:44
English(EN) Loong: Synthesize Long Chain-of-Thoughts at Scale through Verifiers

Loong项目支持LLM推理的可扩展合成数据生成

研究人员推出Loong,一个开源框架,旨在为训练推理密集型领域的LLM生成和验证合成数据。该框架包括LoongBench,一个包含12个领域人工审核示例的数据集,以及LoongEnv,一个用于生成新的问答代码三元组的环境。该系统旨在克服可验证数据集有限和监督成本高昂的挑战,使LLM能够通过具有可验证奖励的强化学习来改进其链式思维(CoT)推理。 AI

影响 该框架可能显著降低训练LLM进行复杂推理任务的成本并扩大规模,从而可能带来更强大的AI系统。

排序理由 该集群包含一篇学术论文,详细介绍了用于LLM的合成数据生成和验证的新框架。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

Loong项目支持LLM推理的可扩展合成数据生成

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Xingyue Huang, Rishabh, Gregor Franke, Ziyi Yang, Jiamu Bai, Weijie Bai, Jinhe Bi, Zifeng Ding, Yiqun Duan, Chengyu Fan, Wendong Fan, Xin Gao, Ruohao Guo, Yuan He, Zhuangzhuang He, Xianglong Hu, Neil Johnson, Bowen Li, Fangru Lin, Siyu Lin, Tong Liu, Yu… ·

    Loong:通过验证器大规模合成长链思考

    arXiv:2509.03059v2 Announce Type: replace-cross Abstract: Recent advances in Large Language Models (LLMs) have shown that their reasoning capabilities can be significantly improved through Reinforcement Learning with Verifiable Reward (RLVR), particularly in domains like mathemat…