PulseAugur
实时 08:17:39
English(EN) The Illusion of Cross-Lingual Safety in Low-Resource Languages

研究发现:大型语言模型(LLM)的安全防护未能跨越低资源语言

一篇新发表在arXiv上的研究论文强调了大型语言模型(LLM)跨语言安全性的显著局限性。该研究聚焦于四种非洲语言——Twi语、豪萨语、阿姆哈拉语和斯瓦希里语,发现为英语开发的安全性对齐方法并未有效迁移到这些低资源语言中。研究人员使用了一个名为LoDNA的新数据集和一个潜在几何框架,发现有害提示保留的英语拒绝信号不到10%,这表明当前的跨语言安全措施是肤浅的。 AI

影响 突显了大型语言模型在非英语语言方面的安全关键性差距,可能影响全球人工智能部署,并需要新的对齐策略。

排序理由 该集群包含一篇详细介绍大型语言模型(LLM)安全局限性新发现的研究论文。

在 Hugging Face Daily Papers 阅读 →

AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →

研究发现:大型语言模型(LLM)的安全防护未能跨越低资源语言

报道来源 [2]

  1. arXiv cs.CL TIER_1 English(EN) · Abigail Oppong, P Sam Sahil, Tadesse Destaw Belay, Maryam Ibrahim Mukhtar, Esmael Ahmed Abdu, Tassallah Abdullahi, Jessica Oparebea, Saminu Mohammad Aliyu, Idris Abdulmumin, Abubakar Juma Chilala, Nicholaus Dismas Ladislaus, Alfred Malengo Kondoro, Lemof… ·

    低资源语言的跨语言安全幻觉

    arXiv:2608.11146v1 Announce Type: new Abstract: Safety alignment in large language models (LLMs) is largely developed in English, assuming these safeguards generalize across multilingual settings. However, this assumption remains underexplored and exposes a vulnerability in low-r…

  2. Hugging Face Daily Papers TIER_1 English(EN) ·

    低资源语言的跨语言安全幻觉

    Safety alignment in large language models (LLMs) is largely developed in English, assuming these safeguards generalize across multilingual settings. However, this assumption remains underexplored and exposes a vulnerability in low-resource languages. We investigate cross-lingual …