PulseAugur
实时 10:27:12
English(EN) Safety Alignment Illusion: The Cross-Lingual Safety Gap in LLMs

新基准揭示大型语言模型中的跨语言偏见

一项名为INCLUDE的新基准已被开发出来,用于评估大型语言模型(LLMs)在各种印度语言中的社会文化偏见。目前,大型语言模型的安全对齐主要集中在英语上,这可能导致在多语言环境中使用这些模型时产生潜在危害。INCLUDE基准包含2,604个英语、印地语、孟加拉语、马拉地语、泰米尔语和混合英语(Hinglish)的提示,用于评估十个大型语言模型。结果表明,在开源模型中,孟加拉语表现出最高的平均偏见;而在开源模型中,英语偏见最低,但在闭源模型中偏见最高。 AI

影响 凸显了大型语言模型在非英语语言方面存在的关键安全鸿沟,可能影响全球人工智能部署和用户信任。

排序理由 该集群包含一篇介绍用于评估大型语言模型安全性的新基准的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新基准揭示大型语言模型中的跨语言偏见

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Namya Bhatnagar ·

    安全对齐幻觉:大语言模型中的跨语言安全鸿沟

    arXiv:2608.18131v1 Announce Type: new Abstract: Current safety alignment training for Large Language Models (LLMs) are heavily English-centric. When such safety filters fail for non-English languages, the consequences are immediate and user-facing: voice assistants and spoken dia…