引入了一个名为ExecRetrieval的新基准来衡量代码检索系统的功能正确性。该基准包含939个Python任务,每个任务都有一个正确的实现和多达四个执行验证过的、与正确代码几乎相同的错误变体。对23种密集嵌入配置和BM25的评估表明,虽然顶级系统在10个项目(exec@10 = 1.00)时实现了高召回率,但它们在1个项目(exec@1 = 0.331)时的召回率显著降低,大多数排名第一的遗漏是错误的干扰项。 AI
影响 突出了AI代理代码检索中的一个关键差距,表明当前的方法难以区分功能正确的代码和几乎相同的错误版本。
排序理由 该集群描述了一篇介绍代码检索基准的新学术论文。
AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →