PulseAugur
实时 17:49:24
English(EN) "Hey look Opus 5 is not so bad... NO WAIT WTF IT IS HORRIBLE...."

用户发现 Claude Opus 5 在规划任务方面不可靠,尽管初期表现良好

一位用户最初发现 AnthropicClaude Opus 5 像其他用户一样,令人沮丧地冗长且效率低下。然而,在涉及 CAN 网络的一个项目中,Opus 5 表现出乎意料地好,成功识别了 Sonnet 犯下的错误并提出了有效的解决方案。这种积极的体验是短暂的,因为随后尝试使用 Opus 5 创建一个简单的技能,却导致了一个灾难性地复杂且消耗大量 token 的过程,涉及多个代理,使用户质疑 Opus 5 在规划任务方面的可靠性。 AI

影响 突出了大型语言模型性能和用户体验的潜在不一致性。

排序理由 关于特定模型性能的用户体验报告。

在 r/Anthropic 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

用户发现 Claude Opus 5 在规划任务方面不可靠,尽管初期表现良好

报道来源 [1]

  1. r/Anthropic TIER_1 English(EN) · /u/Vibroverbus ·

    "Hey look Opus 5 is not so bad... NO WAIT WTF IT IS HORRIBLE...."

    <!-- SC_OFF --><div class="md"><p>I've struggled with Opus 5 on/off like others. I get the frustrating crazy verbose crazy inefficient token black hole behavior, and then flip to 4.6 sometimes but then end up trying 5 again with different prompting style or assignment in hopes I …