引入了两个新的基准测试E2E-SWE和ORCA,以评估大型语言模型(LLM)在复杂编码任务中的能力。E2E-SWE侧重于LLM从头开始生成整个软件存储库的能力,使用11种编程语言对13个前沿模型进行了测试,结果显示性能差异显著。另一方面,ORCA评估LLM在数据科学库之间翻译代码的熟练程度,结果表明即使是像Claude Opus-4.6这样的先进模型也难以胜任这项任务,这促使开发了一种意图增强的翻译方法。 AI
影响 这些基准测试突显了LLM在复杂软件工程任务中当前的局限性,指明了AI编码能力未来研究和发展的方向。
排序理由 该集群包含两篇介绍用于评估LLM的新基准的学术论文。
- alphaXiv
- arXiv
- CatalyzeX
- Claude Opus-4.6
- Connected Papers
- CORE Recommender
- DagsHub
- Gotit.pub
- Hugging Face
- Litmaps
- ORCA
- ScienceCast
- scite Smart Citations
- coding agents
- data science libraries
- E2E-SWE
- LLMs
- software repositories
- Tests
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →