两篇新研究论文介绍了改进大语言模型对齐的新颖方法,特别解决了现有直接偏好优化(DPO)技术的局限性。第一篇论文TAB-PO提出了一种令牌级自适应屏障,用于将梯度更新集中在结构化生成任务中的关键模式令牌上,在Llama和Qwen模型上于SciERC数据集上显示出显著改进。第二篇论文TokenRatio提出了令牌级Bregman偏好优化(TBPO),这是一种将DPO推广到令牌级决策的原则性方法,在各种基准测试中提高了对齐质量、训练稳定性和输出多样性。 AI
影响 这些新的令牌级偏好优化技术可能导致更精确、更高效地针对特定任务对大语言模型进行微调,从而提高在结构化生成和指令遵循方面的性能。
排序理由 两篇介绍大语言模型对齐新颖方法的学术论文。
- TBPO
- Tien-Phat Nguyen
- TokenRatio
- arXiv
- Direct Preference Optimization
- Hugging Face
- Llama
- Qwen
- Samah J Fodeh
- SciERC
- TAB-PO
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →