一项初步研究探讨了大型语言模型(LLM)从源代码提交中提取架构设计决策的有效性。研究人员使用零样本和少样本提示,在 30 个开发人员编写的决策上测试了四种大型语言模型——Gemini 3-Pro、DeepSeek-R1、Kimi K2 和 Qwen3。虽然所有模型都达到了高于 0.81 的 BERT-F1 分数,但少样本提示显示出轻微的改进。然而,生成的决策通常过长、侧重于实现,并且缺乏根本原因,这表明需要更具架构意识的大型语言模型系统。 AI
影响 强调了软件工程和自动化知识管理中具有架构意识的大型语言模型系统的机遇。
排序理由 该集群包含一篇详细介绍大型语言模型能力研究的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →