研究人员开发了IHDec,一种新颖的方法来解决大型语言模型(LLM)在多轮对话中指令层级失败的问题。与需要昂贵微调的先前解决方案不同,IHDec通过使用Jensen-Shannon散度来检测和纠正下级指令覆盖上级指令的违规行为,从而在无需训练的情况下运行。评估表明,IHDec在处理多轮冲突方面优于基于训练的方法,同时保持响应质量并增强了对抗性攻击的安全性。 AI
影响 增强了LLM在复杂、多轮指令场景下的可靠性,并提高了对抗性输入的安全性。
排序理由 详细介绍LLM新方法的学术论文。
- alphaXiv
- arXiv
- CatalyzeX
- CORE Recommender
- DagsHub
- Gotit.pub
- Hugging Face
- IHDec
- Jensen-Shannon divergence
- large-language models
- Nicole Geumheon Liu
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →