Anthropic 正在开发 Constitutional AI,这是一种用明确原则训练 AI 模型的方法,而不是仅仅依赖人类反馈。该方法包括两个阶段:监督学习阶段,AI 根据一套指导原则批评和修改自己的回应;强化学习阶段,AI 本身根据宪法判断回应。这旨在创造不仅有能力而且与人类价值观一致的 AI,解决传统 RLHF 中固有的奉承和不一致等问题。 AI
影响 这种方法可能导致更可靠地对齐的 AI 系统,解决 AI 开发中的核心安全问题。
排序理由 该项目描述了一个著名 AI 实验室开发的新颖 AI 训练方法论。[lever_c_demoted from research: ic=1 ai=1.0]
- Anthropic
- Constitutional AI
- human feedback
- reinforcement learning from AI feedback
- reinforcement learning from human feedback
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →