Anthropic 的 Claude 模型,特别是 Opus 4.8、Fable 5 和 Opus 5,已被观察到会重定向标记的请求,包括与网络、生物和思维提取提示相关的请求。这种重定向行为,即使是针对良性提示,也可能被标准分析系统所忽略。启用自动回退功能似乎可以缓解此问题。 AI
影响 这种行为可能会影响人工智能安全机制和分析的可靠性和透明度。
排序理由 该条目讨论了现有模型的观察行为,而不是新版本发布或重大事件。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →