研究人员开发了一个新的基准IssueLoc-Bench,用于评估不同AI模型在编码代理管道中进行代码库探索的成本效益。研究发现,虽然更高质量的探索器表现最佳,但显著更便宜的模型可以在大幅减少代理时间和token使用量的同时,保留相当一部分的定位质量。探索器模型的选择应取决于定位信息下游的使用方式,其中排名和覆盖率等指标适用于候选者交接,而F1和精确匹配则适用于限制性文件门。 AI
影响 这项研究通过优化代码库探索阶段,有望带来更高效、更具成本效益的软件开发AI代理。
排序理由 介绍新基准和AI模型评估方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX Code Finder for Papers
- CORE Recommender
- DagsHub
- Gotit.pub
- Hugging Face
- Influence Flower
- IssueLoc-Bench
- Mohammad Nour Al Awad
- ScienceCast
- SWE-bench
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →