Reddit 的 ClaudeAI 社区的一位用户报告了 Anthropic 的“网络验证”计划存在问题,发现即使在验证后,大多数模型(如 Opus 5.5 和 Mythos)仍会标记他们的对话或拒绝执行安全相关的任务。用户发现只有 Sonnet 4.6 有些可用,但即使是它也表现出奇怪的行为,例如在生成的代码中将客户标记为“受害者”。这种经历导致对该计划的预期范围和处理现实世界漏洞的有效性感到困惑。 AI
影响 突出了生产模型中 AI 安全护栏的潜在局限性和用户体验问题。
排序理由 用户对产品功能的评论,而非主要来源发布或重要的行业事件。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →