一篇新发布的 arXiv 研究论文评估了 Anthropic 的 Claude AI 模型(特别是 Sonnet 和 Opus 4.6 及更高版本)生成的 Python 测试的质量。研究发现,这些由 AI 生成的测试在质量上与 Django 和 Pandas 等成熟的开源项目中的人类编写的测试相当。评估采用了严格的协议,包括故障注入和定性设计评分标准,评估的是单个测试而非整个测试套件,以 pinpoint 改进的具体领域。 AI
影响 展示了 AI 在生成高质量代码方面的日益增长的能力,有可能加速软件开发和测试。
排序理由 评估 AI 模型能力的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →