名为 SWE-sweep 的新基准测试由来自 Meta、Stanford、Harvard 和 UW 的研究人员开发,旨在评估 AI 模型在用户遇到之前查找和修复代码中错误的能力。该基准测试使用了大型代码库中的真实错误。早期结果表明,OpenAI 的 Luna 模型具有成本效益,以一小部分成本实现了其他模型相当大的分数。 AI
影响 该基准测试可能会推动更主动的 AI 编码助手的发展,这些助手能够在影响用户之前识别和解决问题。
排序理由 该集群描述了一个用于评估 AI 模型代码调试能力的新基准测试,包括其创建和初步结果的详细信息。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →