PulseAugur
实时 11:30:49
English(EN) Supabase Releases Evals: an Open Source Benchmark That Scores Claude Code, Codex and OpenCode on Real Supabase Tasks

Supabase 发布开源基准测试,用于评估 AI 编码代理 · 跟踪 2 个来源

Supabase 发布了一个名为 Evals 的开源基准测试和框架,用于评估 AI 编码代理。该工具在真实的 Supabase 任务(如模式创建和调试)上测试 Claude CodeCodexOpenCode 等代理,并使用容器化环境进行现实测试。初步发现表明,虽然 Opus 5Kimi K3 等顶级模型在没有帮助的情况下表现良好,但较小的模型在获得专业技能后会显著提高,并且所有代理在处理迁移和身份验证验证方面都显示出弱点。 AI

影响 该基准测试提供了一种标准化方法,用于在真实任务上评估 AI 编码代理,有可能推动代理能力和工具的改进。

排序理由 该集群描述了用于评估 AI 编码代理的开源基准测试和框架的发布,属于研究和工具类别。

在 MarkTechPost 阅读 →

AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →

Supabase 发布开源基准测试,用于评估 AI 编码代理 · 跟踪 2 个来源

报道来源 [2]

  1. MarkTechPost TIER_1 English(EN) · Michal Sutter ·

    Supabase Releases Evals: an Open Source Benchmark That Scores Claude Code, Codex and OpenCode on Real Supabase Tasks

    <p>Supabase has open sourced supabase/evals, an Apache-2.0 benchmark and framework that runs coding agents including Claude Code, Codex and OpenCode against real Supabase tasks — building schemas, debugging Edge Functions, fixing RLS policies — inside containerized stacks, then s…

  2. Mastodon — fosstodon.org TIER_1 English(EN) · [email protected] ·

    Supabase has released an open-source benchmark called Evals that tests AI coding agents including Claude Code, Codex and OpenCode against real Supabase tasks li

    Supabase has released an open-source benchmark called Evals that tests AI coding agents including Claude Code, Codex and OpenCode against real Supabase tasks like building schemas, debugging Edge Functions and fixing RLS policies. The benchmark runs agents in containerised enviro…