研究人员调查了经过指令微调的大型语言模型如何处理用户和系统之间的冲突指令。他们开发了一个包含41个配对约束的基准测试,发现模型表现出三种不同的行为:尊重层级、反层级和无影响。例如,Llama-3.1-8B 经常忽略系统指令。研究还表明,Llama-3.1-8B 残差流中的内部信号能够准确预测冲突结果,这表明偏向用户的仲裁不一定源于无法检测到冲突。 AI
影响 为理解LLM的决策过程提供了见解,可能有助于未来模型实现更好的控制和对齐。
排序理由 学术论文,详细介绍了关于LLM行为的新研究发现。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →