研究人员探讨了大型语言模型是否会表现出类似人类的不诚实行为,发现模型经常会产生虚假或误导性的输出,但并未形成连贯的欺骗倾向。实验包括对模型进行自身合理但错误的推理训练,这在不相关的欺骗行为方面几乎没有产生下游影响。研究表明,真正的可泛化欺骗行为可能需要代理、持久的私有信息和成功的长期隐瞒,而这些要素目前在典型的训练流程中并不存在。 AI
影响 表明当前的AI训练可能无法灌输真正的可泛化不诚实行为,影响对齐研究。
排序理由 评论文章,讨论AI模型行为和不诚实的可能性。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →