实体
CoderEval: A Benchmark of Pragmatic Code Generation with Generative Pre-trained Models
CoderEval: A Benchmark of Pragmatic Code Generation with Generative Pre-trained Models
PulseAugur coverage of CoderEval: A Benchmark of Pragmatic Code Generation with Generative Pre-trained Models — every cluster mentioning CoderEval: A Benchmark of Pragmatic Code Generation with Generative Pre-trained Models across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
新的ACToR框架通过定位关键标记来增强AI代码生成
研究人员开发了一个名为ACToR(自适应关键标记感知检索)的新框架,以改进仓库级代码生成。该方法在代码生成过程中识别关键标记,如果这些标记生成不正确,可能导致重大的功能故障。ACToR针对这些关键标记触发仓库上下文的定向检索,从而提高生成代码的准确性和一致性。在RepoExec和CoderEval基准测试上的评估表明,ACToR优于现有的最先进方法,并显示出显著的性能提升。
-
研究发现:量化对代码生成模型影响不同
一项新研究调查了各种量化方法对大型代码生成模型在资源受限硬件上运行时性能的影响。研究人员使用 Python 和 Java 基准测试,在 Qwen2.5-Coder 和 CodeLlama 模型上评估了包括 GPTQ、AWQ 和 AQLM 在内的六种最先进技术。研究结果表明,量化方法对代码的正确性和质量有显著且不同的影响,其中 AQLM 的表现与全精度模型相当,而 QuIP# 的性能下降最大。