两篇新研究论文深入探讨了让大型语言模型拒绝有害请求的机制。第一篇论文比较了监督微调、推理增强微调和 ORPO 等不同的训练后方法在各种模型上的表现,发现训练方法显著改变了内部拒绝计算。第二篇论文研究了表示控制,揭示了控制向量主要与注意力机制的 OV 电路交互,并且在很大程度上忽略了 QK 电路,有可能在不损失性能的情况下进行显著稀疏化。 AI
影响 提供了对大型语言模型安全机制的更深入理解,可能导致更鲁棒和可控的 AI 系统。
排序理由 两篇在 arXiv 上发表的学术论文,详细介绍了对大型语言模型安全机制的研究。
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- IArxiv
- large language models
- ScienceCast
- Stephen Cheng
- Gemma 2 9B
- Llama-3.1:8b
- Optimized Ranking With Pairwise Observations
- Qwen3_8B
- reasoning-augmented fine-tuning
- supervised fine-tuning
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →