PulseAugur
实时 08:25:40
English(EN) Aligned in Form, Not in Meaning: The Comprehension - Containment Decoupling of LLM Safety in Low-Resource Bangla Derogatory Speech

语言模型安全对齐在低资源孟加拉语贬损性言论中失效

一篇新发表在arXiv上的研究论文,调查了大型语言模型(LLMs)在处理低资源语言时的安全对齐问题,特别关注孟加拉语中的贬损性言论。研究发现,语言模型在准确理解和遏制孟加拉语中的有害内容方面存在困难,表现出显著的理解缺陷,同时保持高令牌泄露率。研究强调,目前基于高资源语言的安全对齐方法,对于低资源场景来说是不够的,因为模型优先考虑表面线索而非实际有害意义。诸如思维链(Chain-of-Thought)推理和专家角色设定等技术进一步加剧了遏制问题,表明需要以意义为基础的安全协议。 AI

影响 凸显了语言模型在低资源语言安全方面存在的关键差距,亟需新的对齐策略。

排序理由 关于语言模型在低资源语言中安全局限性的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

语言模型安全对齐在低资源孟加拉语贬损性言论中失效

报道来源 [1]

  1. arXiv cs.CL TIER_1 English(EN) · Shadab Bin Habib, A K M Ferdous Reza Habib, Subarno Neel, Adib Sakhawat ·

    Aligned in Form, Not in Meaning: The Comprehension - Containment Decoupling of LLM Safety in Low-Resource Bangla Derogatory Speech

    arXiv:2608.02941v1 Announce Type: new Abstract: We audit five frontier large language models on native Bangla derogatory speech (gali) across six protocols to test a single hypothesis: Comprehension-Containment Decoupling. We propose that contemporary safety alignment is bound to…