PulseAugur
实时 07:30:19
实体 MCR-Bench

MCR-Bench

PulseAugur coverage of MCR-Bench — every cluster mentioning MCR-Bench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_223161 ·

    新的 MCR-Bench 基准测试评估多轮代码审查中的 LLM

    研究人员推出了 MCR-Bench,这是一个新颖的基准测试,旨在评估大型语言模型 (LLM) 在现实、多轮代码审查场景中的能力。与以前的静态方法不同,MCR-Bench 捕捉了代码审查的动态、迭代性质,并结合了五种编程语言的缺陷元数据和跨轮状态注释。实验表明,当前主流 LLM 在缺陷检测和状态跟踪方面存在困难,尤其是在交互轮数增加的情况下,并且在不同缺陷类型和严重性级别上表现各异。