研究人员推出 RepoProbe,这是一个旨在评估大型语言模型 (LLM) 理解软件存储库架构能力的新基准。与依赖 GitHub Issues 且可能被模式匹配绕过的先前基准不同,RepoProbe 使用 GitHub Discussions 来处理开放式架构问题。这种方法旨在减少“编辑偏差”,即模型在不理解现有结构的情况下过早地提出代码更改。该基准还包含一个基于清单的验证协议,以确保对 LLM 响应进行客观评估,解决了传统标量评分方法的高变异性和低可解释性问题。 AI
影响 该基准通过解决架构理解和减少过早的代码生成,有望使软件工程领域的 LLM 更加健壮。
排序理由 该集群描述了一篇介绍用于评估 AI 模型的新颖基准的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Checklist-Based Verification Protocol
- Edit Bias
- GitHub Discussions
- GitHub Issues
- large-language models
- RepoProbe
- SOTA LLMs
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →