研究人员为直接对齐算法(DAA),如DPO,开发了一种新的正则化技术,以减轻大型语言模型(LLMs)的过度优化问题。该方法旨在维持首选响应的似然性,从而改善生成质量与通用基准能力之间的权衡。该正则化技术应用于基于参考和无参考的方法,在AlpacaEval2等基准测试和通用性能指标上均有所提升,特别是对于Llama 3.1 8B-Instruct等模型。 AI
影响 这项研究通过改进对齐技术,有望带来更稳定、更强大的大型语言模型,从而提升在各种基准测试上的性能。
排序理由 该集群包含两篇学术论文,讨论了在机器学习环境中优化奖励函数的方法。
- AlpacaEval2
- arXiv
- CBCP19
- Cesa-Bianchi et al.
- Direct Preference Optimization
- Francesco Bacchiocchi
- Llama 3.1 8B-Instruct
- Zhu+23
- Zhu et al. reply
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →