本文探讨了AI代理的可纠正性概念,特别是质疑为何此类代理应该优先考虑当前指令而非过往指令。作者认为,虽然可纠正性并不严格偏爱当下,但它根本上要求代理保持对其主人的开放纠正。这种被纠正的能力,而非时间偏好,被认为是代理应该服从更新指令的核心原因。 AI
影响 探讨AI代理对齐和控制的理论基础。
排序理由 该条目是对AI代理行为(特别是可纠正性)的哲学探讨,以LessWrong博客文章的形式呈现。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →