两篇新研究论文探讨了大语言模型(LLM)拒绝行为的复杂性。第一篇论文《知识型和安全型拒绝的统一机制分析》提出,尽管知识型和安全型拒绝共享潜在机制,但在后续层级上存在分歧,安全型拒绝向知识型拒绝的迁移更强。第二篇论文《安全性的不稳定性:随机种子和温度如何暴露LLM不一致的拒绝行为》表明,由于随机种子和温度设置引入的不一致性,LLM的安全评估并不可靠,有相当比例的提示会表现出决策翻转。 AI
影响 强调需要更鲁棒的LLM安全评估协议,以应对模型行为中的随机变化。
排序理由 两篇发表在arXiv上的学术论文,分析了LLM的拒绝机制和稳定性。
- Claude 3.5 Haiku
- Gemma-3-12B
- Llama-3.1:8b
- LLaMA-70B
- Qwen 2.5 7B
- Qwen 3:8b
- arXiv
- knowledge-based refusal
- safety-based refusal
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →