研究人员推出Dr. Zero,一个新颖的框架,旨在使大型语言模型(LLM)搜索代理无需依赖精选的训练数据即可自我进化。该方法利用外部搜索引擎作为代理的知识环境,并包含一个自我进化反馈循环,其中一个提议代理生成多样化的问题来训练一个求解代理。为了提高训练效率,该框架采用了跳跃分组相对策略优化(HRPO),该方法将相似的问题聚类以减少计算开销。实验表明,Dr. Zero在问答基准测试中可以媲美或超越监督搜索代理的性能,证明了仅通过自我进化即可产生强大的代理搜索和推理能力的潜力。 AI
影响 这项研究可能显著减少训练AI代理所需的大型精选数据集,从而加速开发和部署。
排序理由 详细介绍新AI框架和方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →