研究人员开发了一个新的概率框架,称为“ (k, \epsilon)-unstable ”,为大语言模型 (LLMs) 提供更现实的针对越狱攻击的安全保证。该方法通过放宽其在实践中很少满足的严格“k-unstable”假设,改进了现有的 SmoothLLM 防御。新框架结合了攻击成功率的经验模型,为寻求增强 LLM 对安全对齐漏洞利用的抵抗力的实践者提供了一个更值得信赖且可操作的安全证书。 AI
影响 提供了一种更实用且具有理论基础的机制,使大语言模型更能抵抗安全对齐漏洞的利用。
排序理由 学术论文,详细介绍了大语言模型安全的新理论框架。[lever_c_demoted from research: ic=1 ai=1.0]
- Adarsh Kumarappan
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Greedy Coordinate Gradient
- Hugging Face
- IArxiv
- (k, \epsilon)-unstable
- ScienceCast
- SmoothLLM
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →