来自 Meta、Stanford、Harvard 和 UW 的研究人员开发了 SWE-sweep,这是一个新的基准测试,旨在评估大型语言模型在影响用户之前主动识别和修复大型代码库中 Bug 的能力。该基准测试使用真实世界的 Bug,并根据模型在给定代码库中查找和解决这些问题的成功程度对其进行评分。早期结果表明,虽然一些模型表现不佳,但 Luna xhigh 显示出成本效益,研究人员正在寻求推荐其他开源模型以纳入未来的更新。 AI
影响 该基准测试有望推动能够主动检测错误的更强大的 AI 编码助手的发展。
排序理由 学术研究人员发布了新的基准测试和论文。[lever_c_demoted from research: ic=1 ai=1.0]
- Claude 3
- Code Llama
- DeepSeek Coder
- GPT-4
- Harvard
- Llama 2
- LMSYS Chatbot Arena
- Luna xhigh
- Meta
- Mistral AI
- Mixtral
- Phind
- Stanford
- StarCoder2
- SWE-sweep
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →