研究人员开发了一个名为 Golden-GRPO Injection (GRIN) 的新框架,以改进大型语言模型吸收新信息的方式。与倾向于记忆事实的传统监督微调 (SFT) 不同,GRIN 使用混合策略强化学习算法,使模型能够泛化其原始格式之外的知识。这种方法在旨在测试新知识获取和反事实推理的基准测试中表现出优越的性能,为构建更具适应性和知识更丰富的 AI 系统指明了方向。 AI
影响 这项研究可能带来更具适应性、更能整合新信息的大型语言模型,从而提高它们在动态环境中的效用。
排序理由 该集群包含一篇学术论文,详细介绍了在大型语言模型中持续知识注入的新方法。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →