一项名为BanglaSafe的新基准已被开发出来,用于评估大型语言模型(LLM)在孟加拉语(全球第七大使用语言)中的安全性。该基准包含879个提示,涵盖17个具有文化特异性的危害类别和五种不同的提示条件。对18个前沿LLM的评估显示,超过一半的响应不安全或部分不安全,其中14.7%包含严格有害的内容。值得注意的是,孟加拉语提示中的写作风格对安全性的影响比语言转换本身更大,而且现有的安全分类器在孟加拉语内容上的表现不佳。 AI
影响 强调了对LLM进行更多具有文化多样性的安全评估的必要性,这可能会影响未来的模型开发和部署策略。
排序理由 该集群包含一篇学术论文,该论文引入了一个用于评估非英语语言LLM安全性的新基准。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →