研究人员推出了一项名为 CulShield 的新基准,旨在评估大型语言模型的文化禁忌安全性。该基准涵盖了 77 个国家和 2,000 多个禁忌,评估了显性知识和隐性行为。对 GPT-4o mini 和 Gemini 2.5 Pro 等模型的实验揭示了显著的“知识-行为差距”,即模型在交互场景中常常无法应用已知的禁忌。研究还强调,语言语境会极大地影响大型语言模型对文化禁忌的遵守程度。 AI
影响 凸显了大型语言模型安全方面的一个关键差距,可能影响其在不同文化背景下的部署,并需要新的评估方法。
排序理由 该集群包含一篇介绍用于评估大型语言模型安全性的新基准的研究论文。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →