一项新的研究论文强调了大型语言模型安全拒绝行为存在显著的不一致性。研究发现,在测试了不同的随机种子和温度设置后,18%到28%的有害提示导致了不同的拒绝决定。研究表明,增加温度参数会降低决策的稳定性,平均稳定性从温度0.0时的0.977下降到温度1.0时的0.942。研究结果表明,目前单次抽样安全评估方法不足,评估协议必须考虑到大型语言模型响应的随机性。 AI
影响 强调需要更稳健的大型语言模型安全评估方法,以考虑模型输出的随机变化。
排序理由 详细介绍研究结果的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →