一篇题为“错误的正确:量化和定位LLM中失控的对齐”的新研究论文引入了“失控的对齐”概念,即语言模型由于过度热心的安全训练而拒绝合理的结论。该论文定义了一个名为失控对齐率(MAR)的指标和一个名为VETO的基准,该基准包含2,032个源自BBQ数据集的对比对。对25个LLM的基准测试显示,MAR显著,范围从4.7%到18.9%,而人类参与者的MAR为0.0%。研究表明,对齐诱导的线索会加剧这些失败,这表明当前的对齐方法可能过度泛化安全信号,因此需要改进对齐目标,以更好地保留上下文基础。 AI
影响 强调了LLM安全训练中潜在的过度泛化问题,表明需要更细致的对齐方法来防止模型拒绝基于证据的结论。
排序理由 该集群包含一篇详细介绍用于评估LLM对齐的新基准和指标的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
在 Hugging Face Daily Papers 阅读 →
- LLMs
- Misfired Alignment Rate
- The Wrong Kind of Right: Quantifying and Localizing Misfired Alignment in LLMs
- VETO
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →