研究人员推出了一种名为“Statutory AI”的新方法,用于使大型语言模型符合法律规范。该方法利用预先存在的人工撰写的法律文本作为宪法框架,使人工智能系统能够自主地批评和修改其输出。在涉及 1,000 个关于歧视和欺诈等五个主题的红队测试提示的实验中,Statutory AI 将有害内容减少了 52-59 个百分点,性能比 Constitutional AI 提高了约 10 个百分点,同时计算时间也缩短了 50% 以上。 AI
影响 这种方法可能带来更强大、更符合法律规定的人工智能系统,减少内容审核中对大量人工监督的需求。
排序理由 该条目是一篇学术论文,详细介绍了一种新的人工智能对齐方法。[lever_c_demoted from research: ic=1 ai=1.0]
- abuse of vulnerable persons
- arXiv
- Constitutional AI
- discrimination
- fraud
- Good-for-Humanity principle
- large-language models
- violence
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →