研究人员开发了CuSearch,一个使用带可验证奖励的强化学习(RLVR)来训练基于代理的检索增强生成(RAG)系统的新框架。该方法通过优先考虑提供更具信息量监督的更深搜索轨迹来解决轨迹均匀采样的问题。CuSearch利用搜索深度贪婪分配(SDGA)将更新预算动态地分配给这些更深的轨迹,从而提高了性能。实验表明,在ZeroSearch基准测试上,相比标准的GRPO,精确匹配点数提高了11.8点。 AI
影响 这项研究可能导致更有效的基于代理的检索增强生成(RAG)系统训练,提高它们检索和利用信息的能力。
排序理由 该集群包含一篇详细介绍AI系统训练新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
- agentic retrieval-augmented generation
- CuSearch
- GRPO
- Jianghan Shen
- Reinforcement Learning with Verifiable Rewards
- RLVR
- Search-Depth Greedy Allocation
- ZeroSearch
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →