研究人员推出 ProcArena,这是一个旨在评估大型语言模型 (LLM) 从自然语言生成 PL/SQL 代码能力的新基准测试。该基准测试涵盖 PostgreSQL 和 Oracle 数据库上的直接生成和交互式开发场景,包括初始开发、代码修改、调试和优化等任务。对七个 LLM 的初步评估显示,在直接模式和交互模式下,表现最好的模型准确率分别仅为 62.2% 和 57.8%,这凸显了在实际的自然语言到 PL/SQL 开发中仍然存在重大挑战。 AI
影响 强调了 LLM 在复杂代码生成任务中的当前局限性,并为未来的研究和开发指明了方向。
排序理由 该集群包含一篇介绍用于评估 LLM 的新基准测试的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- Iterative Logic Enhancement
- Knowledge integration
- LLMs
- natural language
- Oracle
- PL/SQL
- PostgreSQL
- ProcArena
- Requirement Perturbation
- Solver-User Simulator
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →