研究人员开发了一种新的多目标强化学习算法,名为MO-IKE,以改进大型语言模型的上下文知识编辑。该方法将提示构建视为一个结构化实体,同时优化可靠性、泛化性和特异性等竞争性目标,从而解决了先前方法的局限性。MO-IKE训练一个动态检索器来构建更平衡、更连贯的提示,显著提高了Llama-3.2等模型上的编辑成功率和释义一致性。 AI
影响 这项新算法通过实现高效的上下文知识更新,有望使大型语言模型更加适应和保持最新。
排序理由 该集群包含一篇学术论文,详细介绍了用于大型语言模型知识编辑的新算法。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Constrained Markov Decision Processes with Expected Total Reward Criteria
- large-language models
- Llama-3.2
- MO-IKE
- Multi-objective reinforcement learning
- reinforcement learning
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →