PulseAugur
实时 11:47:34
English(EN) G-Zero: Self-Play for Open-Ended Generation from Zero Data

G-Zero框架使LLM能够在无外部数据的情况下自我演进

研究人员推出了一种新颖的框架G-Zero,用于在大型语言模型中进行开放式生成,而无需依赖外部裁判或预先存在的数据。该系统采用一种协同进化方法,其中一个Proposer模型生成具有挑战性的查询和提示,而一个Generator模型则根据这些自我生成的指南学习改进其响应。这种由称为Hint-$\delta$的内在奖励信号驱动的方法,旨在克服代理LLM裁判的局限性,并使模型在复杂、不可验证的领域中能够持续自我演进。 AI

影响 引入了一种新颖的LLM自我改进方法,有可能实现更自主和可扩展的模型开发。

排序理由 发表了一篇详细介绍新AI框架的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

G-Zero框架使LLM能够在无外部数据的情况下自我演进

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Jiaxin Huang ·

    G-Zero:从零数据开始的开放式生成自玩

    Self-evolving LLMs excel in verifiable domains but struggle in open-ended tasks, where reliance on proxy LLM judges introduces capability bottlenecks and reward hacking. To overcome this, we introduce G-Zero, a verifier-free, co-evolutionary framework for autonomous self-improvem…