一项发表在arXiv上的新研究评估了五种领先的生成式AI系统在入门面向对象编程评估中的表现,包括ChatGPT 5.2、DeepSeek-V3、Gemini 2.5 Flash、Claude Sonnet 4.5和M365 Copilot。研究发现,所有评估的AI模型都显著优于平均学生群体,在复杂的编码任务中经常获得满分。然而,这些模型仍然存在局限性,偶尔会生成无法编译的代码,并且在抽象类和某些继承场景等高级面向对象概念以及图形相关问题上遇到困难。研究还指出,与前一年相比,AI的表现有所提高,同时识别出持续存在的错误模式。 AI
影响 表明GenAI在编码教育和评估设计方面的能力日益增强,同时也突出了需要进一步发展的领域。
排序理由 学术论文评估AI在特定任务上的表现。[lever_c_demoted from research: ic=1 ai=1.0]
- ChatGPT 5.2
- Claude Sonnet 4.5
- DeepSeek-V3
- Gemini 2.5 Flash
- generative artificial intelligence
- M365 Copilot
- object-oriented programming
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →