一篇新发表在arXiv上的研究论文,调查了大型语言模型(LLMs)在处理低资源语言时的安全对齐问题,特别关注孟加拉语中的贬损性言论。研究发现,语言模型在准确理解和遏制孟加拉语中的有害内容方面存在困难,表现出显著的理解缺陷,同时保持高令牌泄露率。研究强调,目前基于高资源语言的安全对齐方法,对于低资源场景来说是不够的,因为模型优先考虑表面线索而非实际有害意义。诸如思维链(Chain-of-Thought)推理和专家角色设定等技术进一步加剧了遏制问题,表明需要以意义为基础的安全协议。 AI
影响 凸显了语言模型在低资源语言安全方面存在的关键差距,亟需新的对齐策略。
排序理由 关于语言模型在低资源语言中安全局限性的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →