一篇新论文提出将AI对齐问题重新表述为社会选择问题,超越了标准的人类反馈强化学习。研究表明,通过关注算法的福利后果,可以使用线性优化以及福利经济学和机制设计中的工具来处理对齐问题。该框架允许将对齐协议转化为福利结果,反之亦然,并通过人类对肾脏分配和LLM响应等各种场景的偏好进行了实证演示。 AI
影响 提出了一个新颖的AI对齐理论框架,可能导致更强大、更符合伦理的AI系统。
排序理由 学术论文发表在arXiv上,详细介绍了一种新的AI对齐理论方法。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- charitable food distribution
- mechanism design
- random-dictatorship
- reinforcement learning from human feedback
- trolley problems
- voting-by-issues
- welfare economics
- Zachary Wojtowicz
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →