2026年8月在Anthropic的Reddit板块上发布的一项研究详细介绍了一种称为“上下文诱导激活漂移”的现象,即长篇中性文本会改变AI模型的行为。研究人员观察到,在他们发布了关于哲学和认知文本的帖子后,Anthropic的Claude模型开始将此类内容视为潜在攻击,导致拒绝响应。该研究认为,这种漂移是一个固有且无法解决的问题,因为能够诱导它的文本集是无限且连续的,这意味着阻止这种攻击向量需要阻止所有文本。 AI
影响 凸显了大型语言模型对齐方面潜在的漏洞,这些漏洞可能会影响它们在处理多样化文本输入时的可靠性和安全性。
排序理由 该条目是研究人员的观点文章和模型行为分析,并非公司直接发布或公告。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →