研究人员开发了一种名为电路推理分数(CRS)的新方法,以改进可验证奖励强化学习(RLVR)的数据选择。与将数据价值视为问题内在属性的先前方法不同,CRS根据模型对其推理电路的参与度来评估数据价值。这种方法在Qwen2.5-Math-7B上进行了测试,结果表明,推理电路参与度较低的数据在GSM8K和OlympiadBench等基准测试中表现更好。 AI
影响 这种新的数据选择方法可能导致更有效和更具影响力的AI模型训练,特别是在复杂的推理任务中。
排序理由 介绍AI研究新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- CircuitLens
- Circuit Reasoning Score
- GSM8K
- Hugging Face
- Minerva
- Qwen2.5-Math-7B
- Reinforcement learning with verifiable rewards
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →