PulseAugur
实时 10:57:32
English(EN) RepoProbe: Benchmarking Architecture-Aware Repository Comprehension with Checklists

新的基准 RepoProbe 评估 LLM 代码理解和编辑偏差

研究人员推出 RepoProbe,这是一个旨在评估大型语言模型 (LLM) 理解软件存储库架构能力的新基准。与依赖 GitHub Issues 且可能被模式匹配绕过的先前基准不同,RepoProbe 使用 GitHub Discussions 来处理开放式架构问题。这种方法旨在减少“编辑偏差”,即模型在不理解现有结构的情况下过早地提出代码更改。该基准还包含一个基于清单的验证协议,以确保对 LLM 响应进行客观评估,解决了传统标量评分方法的高变异性和低可解释性问题。 AI

影响 该基准通过解决架构理解和减少过早的代码生成,有望使软件工程领域的 LLM 更加健壮。

排序理由 该集群描述了一篇介绍用于评估 AI 模型的新颖基准的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的基准 RepoProbe 评估 LLM 代码理解和编辑偏差

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Yuexi Yang, Alyssa Wu, Ji Luo, Richeng Xuan, Zhichao Hu, Yuhong Liu, Zhen Qin ·

    RepoProbe:使用清单对架构感知型存储库进行基准测试和理解

    arXiv:2608.04783v1 Announce Type: cross Abstract: The integration of Large Language Models (LLMs) into software engineering has shifted the focus from function-level generation to repository-scale assistance. However, existing benchmarks largely rely on bug reports from GitHub Is…