PulseAugur
实时 09:17:09
English(EN) Deep Research Pretraining via Predictive Navigation

新的深度研究预训练框架增强了AI代理的训练

研究人员开发了深度研究预训练(DRP)框架,这是一个旨在改进深度研究代理训练的离线框架。DRP从现有证据结构(如引文图谱和超链接)中提取监督信号,将其转换为搜索-打开-写入轨迹。该方法教会模型在不需要实时检索环境的情况下有效地搜索、检查文档和综合证据。在学术引文图谱(DRP-Paper)和Wikipedia超链接(DRP-Web)上进行测试时,DRP的表现始终优于未经训练的模型,即使在数据量较少的情况下也能取得更好的结果,并在下游代理强化学习中显示出优势。 AI

影响 该框架可以显著降低训练高级AI研究代理的成本和复杂性,有可能加速其在复杂信息检索任务中的开发和部署。

排序理由 该集群描述了一篇关于用于AI代理的新型预训练框架的最新研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的深度研究预训练框架增强了AI代理的训练

报道来源 [1]

  1. arXiv cs.CL TIER_1 English(EN) · Jiang Zhou, Zhiyuan Fan, Xing Wu, Tinghao Yu, Feng Zhang, Lilin Wang ·

    Deep Research Pretraining via Predictive Navigation

    arXiv:2608.00432v1 Announce Type: new Abstract: Deep research agents are often trained on expensive, environment-grounded tool-use trajectories that require repeated retrieval, document inspection, and report evaluation. We introduce Deep Research Pretraining (DRP), an offline fr…