研究人员正在开发新的方法来控制和评估大型语言模型的拒绝行为。一种方法使用“拒绝令牌”来微调 Llama 3-8B 等模型,允许在推理时进行引导,以根据提示内容增加或减少拒绝。另一项研究引入了衡量“语义混淆”的指标,评估模型在多大程度上一致地拒绝语义相似的提示,旨在减少错误拒绝并同时保持安全性。 AI
影响 通过更好地控制拒绝机制和更全面地评估其一致性,提高大型语言模型的安全性和可靠性。
排序理由 arXiv 上的两篇学术论文,详细介绍了控制和评估大型语言模型安全拒绝行为的新颖方法。
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →