一种名为GC-OPD的新方法已被开发出来,用于解决大型语言模型上策略蒸馏中的差异。该方法协调了教师模型在token层面的似然度偏好与生成响应的实际任务成功率。标准的上策略蒸馏可能导致不匹配,即响应在局部上是合理的,但未能满足整体任务要求,尤其是在长上下文的情况下。GC-OPD引入了一个残差项,该残差项根据响应级别的验证器奖励来校准教师的信号,将训练更新集中在不一致的区域。 AI
影响 该方法可以提高LLM在需要整合长上下文信息任务中的可靠性。
排序理由 该集群描述了论文中提出的一种改进LLM训练的新方法。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →