一个名为 SDARE-Bench 的新基准已被开发出来,用于评估大型语言模型 (LLM) 在检测和响应对话污名方面的能力。该基准包含 1,138 个二元查询和 1,388 个群体对话场景。对八个 LLM 的初步测试显示,它们在识别污名方面存在显著弱点,尤其是在群体对话中,模型还表现出更高的污名表达率,并提供不太真实的建议。在模拟的群体压力场景中,LLM 在 97.5% 的响应中表达了污名,凸显了关键的安全漏洞。 AI
影响 凸显了 LLM 在复杂对话环境中存在的关键安全漏洞,可能影响其在敏感应用中的部署。
排序理由 该集群描述了一个用于评估 LLM 安全性的新学术基准,发布在 arXiv 上。
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- Large Language Models
- ScienceCast
- SDARE-Bench
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →