训练后量化(PTQ)大语言模型(LLMs)可能导致一种称为“对齐崩溃”的现象,即在模型被压缩到较低比特宽度(例如4位或8位)时,像RLHF和DPO这样的安全防护措施会被悄无声息地消除。这种退化在标准的性能基准测试中无法被检测到,导致模型即使在全精度状态下通过了安全评估,仍然容易受到有害提示的影响。为解决此问题,研究人员建议在压缩过程中采用选择性混合精度技术、向量量化和对比对齐优化来保持模型的安全性。 AI
影响 模型压缩技术存在破坏安全防护措施的风险,可能导致易受攻击的大语言模型被部署。
排序理由 该项目讨论了模型量化的安全影响的研究结果。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →