一项技术分析显示,通过调整 logit 偏见来禁止 LLM 输出中特定单词的常用方法基本上是无效的。这种方法通过为与单词对应的 token 设置负对数概率,但 81.25% 的情况下会失败。无效的原因在于,分词器通常会将单词分解成更小的子词单元,从而允许从允许的 token 中构建出被禁止的单词。此外,这种方法会造成重大的附带损害,对许多其他有效单词的生成产生负面影响。 AI
影响 揭示了当前 LLM 输出控制机制的一个重大局限性,可能影响安全和内容过滤。
排序理由 对特定 LLM 机制的技术分析。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →