PulseAugur
实时 11:49:54
English(EN) The "Knowledge-Behavior Gap" in Cultural Taboo Safety of Large Language Models

新的 CulShield 基准揭示大型语言模型在处理文化禁忌方面存在困难

研究人员推出了一项名为 CulShield 的新基准,旨在评估大型语言模型的文化禁忌安全性。该基准涵盖了 77 个国家和 2,000 多个禁忌,评估了显性知识和隐性行为。对 GPT-4o miniGemini 2.5 Pro 等模型的实验揭示了显著的“知识-行为差距”,即模型在交互场景中常常无法应用已知的禁忌。研究还强调,语言语境会极大地影响大型语言模型对文化禁忌的遵守程度。 AI

影响 凸显了大型语言模型安全方面的一个关键差距,可能影响其在不同文化背景下的部署,并需要新的评估方法。

排序理由 该集群包含一篇介绍用于评估大型语言模型安全性的新基准的研究论文。

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的 CulShield 基准揭示大型语言模型在处理文化禁忌方面存在困难

报道来源 [1]

  1. arXiv cs.CL TIER_1 English(EN) · Ying He, Sihang Jiang, Xingzhou Chen, Zhouhong Gu, Yiwei Gu, Minggui He, Shimin Tao, Hongxia Ma, Yanghua Xiao ·

    大型语言模型文化禁忌安全中的“知识-行为鸿沟”

    arXiv:2608.12341v1 Announce Type: new Abstract: Cultural taboo safety is essential for deploying large language models (LLMs), as culturally insensitive outputs may cause offense or even social harm. However, existing cultural benchmarks primarily assess cultural knowledge or val…