研究人员开发了深度研究预训练(DRP)框架,这是一个旨在改进深度研究代理训练的离线框架。DRP从现有证据结构(如引文图谱和超链接)中提取监督信号,将其转换为搜索-打开-写入轨迹。该方法教会模型在不需要实时检索环境的情况下有效地搜索、检查文档和综合证据。在学术引文图谱(DRP-Paper)和Wikipedia超链接(DRP-Web)上进行测试时,DRP的表现始终优于未经训练的模型,即使在数据量较少的情况下也能取得更好的结果,并在下游代理强化学习中显示出优势。 AI
影响 该框架可以显著降低训练高级AI研究代理的成本和复杂性,有可能加速其在复杂信息检索任务中的开发和部署。
排序理由 该集群描述了一篇关于用于AI代理的新型预训练框架的最新研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- DeepResearch Bench
- Deep Research Pretraining
- DRP-Paper
- DRP-Web
- Qwen3-14B-Base
- ResearchQA
- SimpleQA
- WebWalkerQA
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →