PulseAugur
实时 09:23:45
English(EN) BulkPR-Bench: Benchmarking Queue-Level Governance of Interacting Pull Requests

新基准测试评估 AI 代理管理相互依赖的代码变更

研究人员推出了 BulkPR-Bench,这是一个旨在评估 AI 代理管理和治理交互式拉取请求队列的有效性的新基准测试。该基准测试解决了当拉取请求存在相互依赖性时,联合决定合并哪些更改以及以何种顺序进行合并的挑战,这种情况是顺序处理方法难以应对的。BulkPR-Bench 采用滚动发布协议,并在 18 个真实存储库中包含 581 个新编写的候选拉取请求,并使用关系交付分数 (RDS) 和全局安全门控产量 (Global-SGY) 等指标来评估性能。 AI

影响 该基准测试可能催生更强大的软件开发 AI 代理,从而提高代码集成过程的效率和安全性。

排序理由 该集群描述了在 arXiv 上发布的新基准测试和研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新基准测试评估 AI 代理管理相互依赖的代码变更

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Zetong Xiong, Qiao Zhao, Jun Zhang, Xueying Lyu, Zhi Li, Yixiang Tu, Xiaowen Yang, Yunjie Zhang, Yufeng Wang, Zhe Zhang, Kaize Yu, Hanwen Du, Zhongkai Sun, Zhuoxin Liu, Zekun Lin, Jianwen Yang, Ruining Chen, Ying Zhang, Tingxuan Pan, Ke Chen, Shubin Han,… ·

    BulkPR-Bench:交互式拉取请求的队列级治理基准测试

    arXiv:2608.02685v1 Announce Type: cross Abstract: Coding-agent benchmarks increasingly cover long-horizon, end-to-end, and interactive development, but typically retain one requested outcome or a fixed change sequence. Sequential policies can process a pull-request (PR) queue one…