一项实验显示,Anthropic 的 Claude Code(特别是 Fable 5.1 版本)在其不同的努力程度设置下,并未提高代码质量或正确性。用户发现,“最大”努力设置比“低”设置贵 8 倍,且耗时更长,但生成的代码通过了相同的测试并满足了相同的规范。虽然更高的努力程度确实产生了更多经过分解和防御性的代码,但这些改进并未在基准测试的通过/失败指标中得到体现。 AI
影响 凸显了 AI 编码助手的潜在低效率,建议用户在不产生可衡量改进的情况下,应谨慎对待更高成本的设置。
排序理由 用户进行的实验和对 AI 产品功能的分析。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →