一个名为MirrorCode的新基准测试已被开发出来,用于评估AI模型在大规模、长周期的软件工程任务上的表现。该基准测试涉及从头开始重新实现整个程序,其中一项任务耗资2,600美元,AI花费19天完成。值得注意的是,Claude Opus 4.7成功地重新实现了名为gotree的生物信息学工具包,这项任务估计需要一名人类工程师花费数周时间,而AI仅用了14小时就完成了,花费为251美元。虽然该基准测试旨在防作弊,但预训练数据中可能存在来自开源代码的数据污染的可能性仍然是一个需要考虑的问题。 AI
影响 该基准测试有望加速能够执行复杂、长周期软件工程任务的AI代理的开发。
排序理由 该集群描述了一个用于评估AI在软件工程领域能力的新的基准测试,包括其构建细节和初步结果。
在 Mastodon — mastodon.social 阅读 →
AI 生成摘要 · Google Gemini · 来自 5 个来源。 我们如何撰写摘要 →