Reddit的r/MachineLearning板块的一名用户观察到,在查询前添加一个长的、非指令性的文本前缀,可以绕过大型语言模型(LLM)的安全过滤器并降低拒绝率。这种现象似乎会持续整个会话。用户以Gemma为例进行了演示,在一个敏感问题前加上关于LLM过度合格的良性元文本后,该问题收到了未经审查的回复。该用户推测,这个前缀充当了“状态锚点”,将模型的激活转移到更接近其预训练分布,从而减弱了RLHF约束的影响。 AI
影响 表明了探测和可能操纵LLM安全机制的一个新途径。
排序理由 用户对LLM行为的观察和假设,而非正式发布或研究论文。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →