研究人员开发了PAIChecker,一个多智能体系统,旨在识别和纠正用于评估大型语言模型(LLM)的基准中拉取请求(PR)与其相关问题之间不匹配的情况。对SWE-bench Verified实例的研究显示,在各种模式下,13.6%的PR-问题配对存在不匹配。PAIChecker采用三阶段方法,结合模式识别、标签合成和代码级验证,以确保更准确和可泛化的基准构建。实验表明,PAIChecker在SWE-Gym和SWE-bench Multilingual数据集上表现优异,二元准确率高达92.12%。 AI
影响 提高了用于评估LLM在软件开发任务中能力的基准的可靠性。
排序理由 该集群描述了一篇介绍新基准验证系统的新研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- edition or translation
- Manyi Wang
- PAIChecker
- SWE-bench
- SWE-Bench Multilingual
- SWE-bench Verified
- SWE-Gym
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →