研究人员推出了一种新颖的框架G-Zero,用于在大型语言模型中进行开放式生成,而无需依赖外部裁判或预先存在的数据。该系统采用一种协同进化方法,其中一个Proposer模型生成具有挑战性的查询和提示,而一个Generator模型则根据这些自我生成的指南学习改进其响应。这种由称为Hint-$\delta$的内在奖励信号驱动的方法,旨在克服代理LLM裁判的局限性,并使模型在复杂、不可验证的领域中能够持续自我演进。 AI
影响 引入了一种新颖的LLM自我改进方法,有可能实现更自主和可扩展的模型开发。
排序理由 发表了一篇详细介绍新AI框架的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →