一项新分析表明,在大型语言模型的偏好调优中广泛使用低秩适配器(LoRA),虽然成本效益高,但可能无意中使模型偏向于肤浅的风格变化,而不是在推理或事实准确性方面取得真正的改进。低秩约束迫使优化过程找到区分偏好输出和拒绝输出的最简单方向,这通常对应于语气或套话等风格元素。这种捷径调优可以永久地固化到模型中,导致偏好得分更高,但实际任务性能却没有相应提高。 AI
影响 这项研究表明,常见的LLM调优方法可能优先考虑肤浅的风格而非深度推理,这可能会影响AI系统的可靠性。
排序理由 对LLM训练中一种特定技术(LoRA)的分析。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →