研究人员推出了一种新颖的自重构蒸馏方法SHARD,旨在增强大型语言模型在安全性和有用性方面的对齐。该技术涉及重写敏感提示以揭示良性意图,将原始响应转化为更安全、更有用的版本,然后对模型进行这些自重构输出的微调。在DNA和LINGUASAFE数据集上的实验表明,SHARD在保持安全性的同时提高了各种模型系列的有用性,并且在性能上可与来自更大教师模型的蒸馏相媲美。 AI
影响 引入了一种改进LLM安全性与有用性的新方法,有望减少有害输出并提高实用性。
排序理由 该集群包含一篇研究论文,详细介绍了一种新的AI对齐方法。
- arXiv
- Hugging Face
- LINGUASAFE
- SHARD
- Viswonathan Manoranjan
- Alex Mallen
- Anders Woodruff
- Aniket Chakravorty
- Buck Shlegeris
- Carlo Leonardo Attubato
- Cody Rushing
- Francis Rhys Ward
- Julian Stastny
- Less Wrong
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →