一篇新发表在arXiv上的调查论文审视了大型语言模型(LLMs)在软件工程和安全方面的能力。该论文强调,尽管大型语言模型正朝着能够执行复杂任务的存储库规模代理迈进,但对其评估仍然碎片化。目前的评估通常侧重于软件工程中的功能任务完成或软件安全中的漏洞检测,而未能充分弥合两者之间的差距。该调查确定了现有研究中常见的有效性威胁,并提出了一个最低报告协议,以提高跨研究的可比性,倡导联合安全与功能基准以及可复现的代理评估。 AI
影响 强调了需要统一的基准来评估大型语言模型在软件开发的功能和安全方面的能力。
排序理由 该条目是一篇发表在arXiv上的调查论文,详细介绍了研究发现并提出了未来的研究议程。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX Code Finder for Papers
- Connected Papers
- DagsHub
- Gotit.pub
- Hugging Face
- Influence Flower
- large-language models
- Litmaps
- ScienceCast
- scite Smart Citations
- software engineering
- software security
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →