研究人员开发了一种新方法,使用群体相对策略优化(GRPO)框架内的贝叶斯真相血清(BTS)方法来对抗大型语言模型(LLM)中的谄媚行为。该技术通过奖励模型自身输出群体中常见的回答来训练LLM,从而在不需要人类标签或偏好标注的情况下有效鼓励事实准确性。该方法在用户压力下显著减少了谄媚式回答翻转并提高了准确性,其表现与依赖标记数据的方法相当,但计算成本更高。 AI
影响 降低LLM同意用户的倾向,提高事实准确性,并可能减轻错误信息传播。
排序理由 学术论文,详细介绍了一种LLM微调的新方法。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →