研究人员调查了道德推理训练对大型语言模型的影响,特别是 Gemma-2-27B/9B 和 Llama-3.1-8B。他们发现,虽然道德训练增强了合作能力和对抗角色扮演攻击的鲁棒性,但它也可能降低在伦理任务上的准确性。该研究采用了对抗性近端策略优化和表征分析等技术,以了解道德训练如何影响模型行为和内部表征,揭示了鲁棒性提升部分是线性的,部分是电路分布式的。 AI
影响 道德训练可以提高大型语言模型的安全性和鲁棒性,但需要仔细评估以平衡伦理准确性。
排序理由 学术论文,详细介绍了关于大型语言模型训练的研究结果。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →