用户报告称 Anthropic 的 Claude Opus 5 模型正在发出永久对话标记,即使是像“你好”这样无害的消息也会触发。这些标记似乎是由整个对话触发的,而不是单个消息,并且似乎不会随着时间的推移或后续的良性互动而清除。用户正在寻求 Anthropic 关于“reasoning extraction”与正常反思性对话之间界限的澄清,以及是否可以重置这些标记,例如通过开始新对话或新账户。 AI
影响 凸显了先进语言模型中 AI 安全机制和用户体验的潜在问题。
排序理由 用户报告的模型行为问题,并非官方公告或发布。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →