两篇新研究论文探讨了 AI 生成代码评估方面的进展。第一篇 TENET 引入了一个使用测试驱动开发的仓库级代码生成框架,在 RepoCod 和 RepoEval 等基准测试中取得了 Claude Sonnet 4 的高 Pass@1 分数。第二篇 ACES 提出了一种评估代码生成评估测试可靠性的新方法,侧重于测试的一致性以及区分正确和错误代码的能力。 AI
影响 这些论文引入了新颖的方法来提高 AI 生成代码评估的可靠性和有效性,有望带来更强大的代码生成模型。
排序理由 两篇在 arXiv 上发表的学术论文,提出了用于评估 AI 生成代码的新方法。
在 Apple Machine Learning Research 阅读 →
- AI agents
- arXiv
- Claude Sonnet 4
- Hui Sun
- large-language models
- LOO-AUC
- pass@k
- RepoCod
- RepoEval
- TENET
- test-driven development
- Yiran Hu
AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →