一篇新发表在arXiv上的研究论文探讨了大型语言模型(LLMs)中安全特性与语言同一性的纠缠。研究表明,大型语言模型的安全对齐在不同语言之间会退化,并且这种不对称性是由内部机制驱动的,其中与安全相关的特性在几何上与语言同一性纠缠在一起。该研究分析了八种语言的三个指令调优的大型语言模型,发现消除安全特性不仅影响有害响应率,还影响目标语言,干预的程度可以通过安全-语言特性关系来预测。这些发现表明,安全对齐的语言普适性依赖于模型架构。 AI
影响 表明大型语言模型的安全对齐并非在所有语言中都普遍适用,并且依赖于模型架构。
排序理由 该集群包含一篇详细阐述大型语言模型安全机制分析的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- Apoorva Upadhyaya
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- large language models
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →