最近的一篇Less Wrong帖子认为,前沿AI开发者应该积极过滤和策划用于模型预训练的数据。作者建议移除对抗性AI叙事,转而用积极的AI-人类互动来填充数据。这种方法旨在降低模型内化对AI个性负面联想的风险,而这种内化在训练后对齐阶段很难纠正。 AI
影响 通过策划预训练数据来培养积极的AI个性并降低负面联想的风险,提出了一种新颖的AI安全方法。
排序理由 该条目是一篇讨论在模型预训练期间一种提议的AI安全方法的观点文章,而不是关于新模型、研究发现或产品的直接公告。
- alignment elasticity
- Anthropic
- Betley et al.
- Ji et al.
- Less Wrong
- Marks et al.
- Persona Selection Model
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →