一篇新的研究论文提出了一个新颖的框架,用于分析大型语言模型(LLM)在非英语语言中的安全护栏为何会失效。提出的多群体项目反应理论(IRT)模型,名为MultiJail,旨在区分语言无关的安全鲁棒性、提示难度和跨语言安全差距等因素。该研究分析了61种模型配置和10种语言的190万个响应,发现安全退化并非仅与低资源语言有关,一些模型在英语中的表现反而更差。该框架实现了0.940 AUC的高预测准确率,为跨语言安全评估提供了一种更细致的方法。 AI
影响 提供了一种更准确的方法来评估和改进不同语言的LLM安全性,可能带来更稳健的全球AI部署。
排序理由 该集群包含一篇详细介绍LLM安全评估新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →