研究人员开发了PsychoSafe框架,通过采用心理学启发的沟通策略来改进大型语言模型拒绝有害请求的方式。这种方法将拒绝重新定义为支持性互动,增强了外部资源推荐和心理基础。另外,另一项研究引入了用于规避拒绝的潜在空间攻击,该研究分析了如何通过操纵模型内部表征来抑制拒绝行为,从而绕过大型语言模型的安全机制。 AI
影响 大型语言模型拒绝策略和规避技术的发展凸显了人工智能安全和对齐方面持续存在的挑战。
排序理由 两篇关于大型语言模型安全和拒绝机制的研究论文。
- Controlled Latent-space Evasion
- Giorgio Piras
- language models
- Large Language Models
- Latent-space Attacks for Refusal Evasion
- PsychoSafe
- Qwen 3.5 27B
AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →