PulseAugur
实时 05:55:56
English(EN) Observations: non-instructional text prefix may bypass RLHF constraints without adversarial prompting? [D]

用户报告称,非指令性文本前缀可绕过LLM安全过滤器

Reddit的r/MachineLearning板块的一名用户观察到,在查询前添加一个长的、非指令性的文本前缀,可以绕过大型语言模型(LLM)的安全过滤器并降低拒绝率。这种现象似乎会持续整个会话。用户以Gemma为例进行了演示,在一个敏感问题前加上关于LLM过度合格的良性元文本后,该问题收到了未经审查的回复。该用户推测,这个前缀充当了“状态锚点”,将模型的激活转移到更接近其预训练分布,从而减弱了RLHF约束的影响。 AI

影响 表明了探测和可能操纵LLM安全机制的一个新途径。

排序理由 用户对LLM行为的观察和假设,而非正式发布或研究论文。

在 r/MachineLearning 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

用户报告称,非指令性文本前缀可绕过LLM安全过滤器

报道来源 [1]

  1. r/MachineLearning TIER_1 English(EN) · /u/Historical-Cod-2537 ·

    观察:非指令文本前缀是否可能在没有对抗性提示的情况下绕过RLHF约束?[D]

    <!-- SC_OFF --><div class="md"><p>I've been running informal experiments on RLHF-aligned LLMs and consistently observing something I can't fully explain. Posting here to get feedback and find out if this is a known phenomenon or if my methodology is flawed.</p> <p><strong>The obs…