研究人员开发了一种名为“滋扰调整最优设计”(NAOD)的新策略,以改进大型语言模型(LLM)主动偏好学习中的比较选择。该方法考虑了LLM裁判可能存在的偏见,这些偏见可能偏离目标人类偏好。NAOD在调整了这些滋扰偏见后,优先考虑与策略相关的信息,并使用Frank-Wolfe算法进行优化。在Chatbot Arena数据上的实验表明,与标准的靶向信息设计相比,NAOD将平均遗憾值降低了29.1%,优于现有方法,并提高了人类偏好预测的准确性。 AI
影响 通过减轻裁判偏见,提高了LLM与人类偏好对齐的效率和准确性。
排序理由 学术论文,详细介绍了一种新的LLM对齐方法。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →