Supabase 发布了一个名为 Evals 的开源基准测试和框架,用于评估 AI 编码代理。该工具在真实的 Supabase 任务(如模式创建和调试)上测试 Claude Code、Codex 和 OpenCode 等代理,并使用容器化环境进行现实测试。初步发现表明,虽然 Opus 5 和 Kimi K3 等顶级模型在没有帮助的情况下表现良好,但较小的模型在获得专业技能后会显著提高,并且所有代理在处理迁移和身份验证验证方面都显示出弱点。 AI
影响 该基准测试提供了一种标准化方法,用于在真实任务上评估 AI 编码代理,有可能推动代理能力和工具的改进。
排序理由 该集群描述了用于评估 AI 编码代理的开源基准测试和框架的发布,属于研究和工具类别。
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →