来自FPT Software AI Center的一篇论文介绍了一个名为RepoExec的新基准测试,该测试通过考虑正确性和依赖调用率来评估大型语言模型在代码生成方面的能力。基准测试显示,当前模型在准确利用提供的依赖项方面存在困难,许多模型未能调用正确的依赖项或重写现有函数而不是解决问题。研究还发现,仅提供函数签名和文档字符串而不提供函数体,可能导致模型将任务误解为少样本示例,从而生成空代码或错误代码。 AI
影响 突出了LLM代码生成能力的一个关键差距,表明当前模型可能无法可靠地集成外部代码依赖项。
排序理由 介绍LLM代码生成新基准的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- Bleu
- Dependency Invocation Rate
- Dung Manh Nguyen
- FPT Software AI Center
- GPT-4o mini
- NAACL 2025 Findings
- Nam Le Hai
- Nghi D. Q. Bui
- Python
- RepoExec
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →