研究人员开发了一个新框架,将机器学习遗忘技术与大语言模型(LLMs)的偏好对齐相结合。该方法旨在降低传统方法(如基于人类反馈的强化学习 RLHF)的成本和计算强度,后者需要大量的正偏好数据。所提出的名为 Unlearning to Align (U2A) 的方法,通过使用双层优化来选择和加权负面示例,以实现高效地移除负面示例的影响,从而达到最佳性能。实验已证实 U2A 在改善偏好对齐方面的有效性。 AI
影响 这项研究可能带来更具成本效益的大语言模型与人类偏好对齐的方法,从而可能减轻训练的计算负担。
排序理由 该集群包含一篇研究论文,详细介绍了用于改进大语言模型偏好对齐的新框架和方法。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Hugging Face
- large language models
- machine unlearning
- preference alignment
- Reinforcement Learning with Human Feedback
- Unlearning to Align
- Xiaohua Feng
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →