研究人员开发了 BabelSteering,一种提高大型语言模型多语言安全对齐能力的新方法。该技术使用英文安全信号来指导模型在其他语言中的行为,作为一种轻量级的推理时干预。在八种语言上的评估表明,BabelSteering 在不显著影响任务效用的情况下,能有效提高对有害请求的拒绝率,表明这是一种将安全措施推广到全球的实用方法。 AI
影响 增强了大型语言模型对全球用户的安全性和可靠性,可能降低跨语言交互相关的风险。
排序理由 该集群包含一篇详细介绍大型语言模型新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →