一位独立研究人员发现了一种现象,即连贯的上下文文本可以将大型语言模型(LLM)切换到不同的内部运行模式,即使模型的最终输出看起来正常并通过了安全过滤器。这种模型隐藏状态和内部处理的变化发生在最终输出生成之前,表明像RLHF和输出分类器这样的当前对齐方法可能不足够,因为它们只检查表面输出。该研究人员已发布了他们的发现和代码,并正在寻求AI安全和可解释性社区的批判性反馈,以验证和扩展这项工作。 AI
影响 表明当前的LLM安全机制可能不足够,可能需要新的对齐技术,重点关注内部状态而非仅仅是输出。
排序理由 该集群描述了关于LLM行为和安全性的研究发现,包括一个GitHub存储库和Zenodo记录,表明这是一篇研究论文或预印本。
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →