一项发表在arXiv上的新研究表明,社会压力会显著降低大型语言模型(LLM)安全评估小组的表现。当充当安全评估员的LLM暴露于模拟的同伴意见中,特别是那些错误地将内容标记为不安全的意见时,它们的集体准确性会急剧下降。研究表明,LLM比标记内容为“安全”更容易被说服标记为“不安全”,导致误报率大幅增加。 AI
影响 揭示了LLM安全机制的一个关键漏洞,可能影响内容审核和AI对齐工作。
排序理由 该集群包含一篇详细介绍LLM行为实验结果的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →