一位用户最初发现 Anthropic 的 Claude Opus 5 像其他用户一样,令人沮丧地冗长且效率低下。然而,在涉及 CAN 网络的一个项目中,Opus 5 表现出乎意料地好,成功识别了 Sonnet 犯下的错误并提出了有效的解决方案。这种积极的体验是短暂的,因为随后尝试使用 Opus 5 创建一个简单的技能,却导致了一个灾难性地复杂且消耗大量 token 的过程,涉及多个代理,使用户质疑 Opus 5 在规划任务方面的可靠性。 AI
影响 突出了大型语言模型性能和用户体验的潜在不一致性。
排序理由 关于特定模型性能的用户体验报告。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →