一篇新的研究论文介绍了一个用于自动化程序修复(APR)模型的多维度评估框架,超越了简单的测试通过率指标。提出的加权质量指数(QI),灵感来自ISO/IEC 25010,纳入了功能正确性、可维护性、安全性和生成效率。当应用于Qwen2.5-Coder和DeepSeek-Coder-V2 Lite模型在错误数据集上的表现时,研究发现模型排名根据QI的加权方案而变化,突显了单一指标评估常常忽略的权衡。值得注意的是,DeepSeek-Coder-V2 Lite混合专家(MoE)模型在使用显著更少的激活参数的情况下,展现出与更大稠密模型相当的正确性,这表明激活参数数量是稀疏代码模型的一个更相关的指标。 AI
影响 为代码生成模型引入了更细致的评估方法,可能指导未来的开发和基准测试。
排序理由 提出AI模型新评估方法的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →