PulseAugur
实时 06:44:12
实体 Multi-SWE-bench

Multi-SWE-bench

PulseAugur coverage of Multi-SWE-bench — every cluster mentioning Multi-SWE-bench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_169732 ·

    大型语言模型注意力模式与自动程序修复成功率相关

    一项新的实证研究调查了大型语言模型(LLMs)如何处理用于自动程序修复的错误报告。研究人员分析了来自SWE-bench Verified和Multi-SWE-bench的319个Python和Java错误的LLMs注意力模式。研究发现,成功的修复通常涉及跨越错误报告的各个组成部分(如描述和堆栈跟踪)的扩散注意力,而失败的修复则倾向于过度集中于元数据(如版本信息)上。这项研究首次证明了注意力分配不当是基于LLM的自动程序修复失败的一个重…