一篇在Alignment Forum和LessWrong上的帖子,通过借鉴人类的社会和道德驱动力,探讨了未来“类脑AGI”的技术对齐问题。作者认为,如果人类能够实现一个美好的未来,那么足够类人化的AGI也能实现,前提是它们拥有亲社会动机。该帖子深入探讨了特定的人类本能、潜在的失败模式(如不正确的道德圈或权力动态),以及将这些驱动力整合到AGI代码中的实现细节。 AI
影响 通过利用人类的社会本能,提出了AGI对齐的新方法,可能指导未来在动机系统方面的研究。
排序理由 该集群包含一篇详细的技术论文,讨论了AI对齐策略。
- Act-based approval-directed agents
- AGI
- corrigibility
- Empowerment
- Intro to Brain-Like-AGI Safety
- Reward Function Design
- Brain-Like-AGI Safety
- Empowerment, corrigibility, etc. are simple abstractions (of a messed-up ontology)
- We need a field of Reward Function Design
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →