研究人员开发了一种名为 Style-Debiased DPO (SD-DPO) 的新方法,用于使用新知识更新大型语言模型 (LLM)。该方法通过使用合成偏好数据来提高知识检索的准确性,其中模型的错误响应与正确响应配对。SD-DPO 特别解决了 LLM 抑制与期望输出仅在风格上不同的事实正确信息的问题。实验表明,SD-DPO 在知识更新方面比继续预训练效率更高,并在 QuALITY 和 AToKE 等基准测试中取得了高准确率。 AI
影响 提高了 LLM 知识更新的效率和准确性,可能减少了广泛重新训练的需求。
排序理由 详细介绍 LLM 知识更新新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →