关于 SWE-bench 可靠性的新系列文章指出,包括专有模型和经过微调的版本(如 SWE-Llama)在内的当前最先进的大型语言模型,只能解决真实世界 GitHub 问题的一小部分(1.96%)。当问题需要多文件推理或系统级理解时,而不仅仅是简单的模式匹配,就会出现这种能力差距。作者计划开发一个混合模型来应对当前模型表现不佳的中等复杂度的软件工程任务。 AI
影响 强调了大型语言模型在复杂推理任务中的当前局限性,表明它们在处理真实世界软件工程问题方面存在巨大差距。
排序理由 该条目讨论了特定任务(SWE-bench)的基准测试结果和模型能力,并引用了一篇 arXiv 论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →