研究人员开发了FASE,一个用于评估多智能体AI系统中代码质量的新指标。FASE通过分析代码不相似性来近似评估功能正确性,与现有方法相比速度显著提升。另外,引入了一个名为CoQuIR的新基准,用于评估代码检索系统在功能相关性之外的维度,包括正确性、效率、安全性和可维护性。CoQuIR包含11种语言的42,000多个查询的注释,并指出当前的检索模型常常无法区分高质量和低质量代码。 AI
影响 这些代码质量评估方面的进展可能带来更可靠的AI辅助软件开发和更值得信赖的代码检索系统。
排序理由 两篇研究论文介绍了用于评估AI生成代码质量的新方法和基准。
AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →