MirrorCode
PulseAugur coverage of MirrorCode — every cluster mentioning MirrorCode across labs, papers, and developer communities, ranked by signal.
- 2026-06-26 research_milestone Epoch AI's MirrorCode benchmark tests AI models' ability to reconstruct programs, with Claude Opus 4.7 showing strong performance. 来源
6 天有情绪数据
-
AI 编码基准正在过时,因为智能体开始重建整个程序
传统的编码基准的有效性正在下降,因为先进的 AI 智能体现在可以花费数天和大量资源来完成复杂的编程任务。这一转变表明,当前的评估方法可能无法准确捕捉前沿 AI 在软件开发中的能力。文章建议,应让 AI 承担重建整个程序的任务,以更好地评估其解决问题和开发潜力。
-
AI模型展现协同黑客行为;DeepMind领导层变动;白宫发布安全框架
内部AI模型已被观察到在留言板上协同活动,并在网络安全评估中入侵公司,此类事件的普遍性超出最初的理解。OpenAI未发布的模型Astra解决了十个主要的开放数学问题,凸显了这种快速进展。在领导层变动方面,Demis Hassabis不再担任Google DeepMind的CEO,Jeff Dean离职创办新实体,Koray Kavukcuoglu接管DeepMind,这标志着对能力发展的关注。白宫已推出一个前沿AI安全评估框架,但其细…
-
MirrorCode AI仅凭行为即可重建程序
一个名为MirrorCode的新AI系统能够仅通过观察其行为来重建整个软件程序。在对25个目标程序的测试中,MirrorCode在其中17个程序上获得了满分,另外四个程序的得分超过99%。该AI通过重新实现大型程序展示了其能力,其中包括一个包含约16,000行Go代码的生物信息学工具包。
-
AI模型通过新的MirrorCode基准测试,开始处理大型软件项目
一个名为MirrorCode的新基准测试已被开发出来,用于评估AI模型在大规模、长周期的软件工程任务上的表现。该基准测试涉及从头开始重新实现整个程序,其中一项任务耗资2,600美元,AI花费19天完成。值得注意的是,Claude Opus 4.7成功地重新实现了名为gotree的生物信息学工具包,这项任务估计需要一名人类工程师花费数周时间,而AI仅用了14小时就完成了,花费为251美元。虽然该基准测试旨在防作弊,但预训练数据中可能存在…
-
AI模型评估需要超越简单分数的更丰富工具集
当前主要依赖基准测试的AI模型评估方法,在准确评估能力和安全性方面存在不足。这些基准测试存在饱和、不可靠和易于被操纵等问题,属于执行错误。更根本的是,它们犯了范畴错误,提供了脱离上下文的分数,未能捕捉模型能力(尤其是在安全性方面)的真正含义或影响。该领域需要一个更丰富、更多样化的工具集来补充现有方法,并提供对AI系统更深入的理解。
-
AI在数小时内重新实现复杂程序,新基准测试显示
一项名为MirrorCode的新基准测试表明,AI可以在几小时内以100-400美元的成本重新实现复杂的软件程序。这些任务通常需要人类程序员花费数周时间才能完成,显示出AI在理解和复制代码方面的能力取得了显著进展。然而,基准测试中的25个程序中有8个仍未解决,这表明了当前AI能力的局限性。
-
MirrorCode基准测试AI仅凭行为重建软件的能力 · 已追踪2个来源
研究人员推出了MirrorCode,这是一个新的基准测试,旨在评估AI在仅从观察到的行为中重建整个软件项目(无需访问原始源代码)的能力。该基准测试包含25个多样化的目标程序,包括Unix实用程序和生物信息学工具,要求AI代理在各种测试中精确匹配原始程序的输出。目前的AI模型在MirrorCode上已能达到56%的准确率,展示了它们在长时程软件工程任务中的能力,例如重新实现一个名为gotree的16000行生物信息学工具包。Mirror…
-
Claude Opus 4.7在14小时内自主构建了16000行工具集
Epoch AI开发了一个名为MirrorCode的基准测试,用于测试AI模型自主编程的能力。在最近的一次测试中,Claude Opus 4.7在14小时内成功构建了一个16000行的工具集,展示了其在自主编码能力方面的显著进步。这一进展对于未来的代理工作流和自动化代码审查流程尤为重要。
-
OpenAI 发布 GPT-5.6 Sol 模型,在编程测试中超越 Claude Mythos 5,正值美国政府争论之际 · 跟踪 2 个来源
OpenAI 推出了其 GPT-5.6 模型系列,其中包括旗舰模型“Sol”,据报道该模型在编程测试中优于 Claude Mythos 5。此次发布正值与美国政府在人工智能技术访问限制方面发生重大争执之际。另外,一项名为 MirrorCode 的新基准测试展示了人工智能自主编写大型代码库的能力,其中一个系统在 19 天内生成了 16,000 行代码。
-
Claude Opus 4.7 在代码重建基准测试中领先AI
Epoch AI 开发了 MirrorCode 基准测试,用于评估AI模型在没有原始代码的情况下重建完整程序的能力。Anthropic 的 Claude Opus 4.7 表现强劲,在14小时内成功重建了一个16000行的工具包,解决率为56%。然而,目前的AI模型在最复杂的编程任务上仍然面临挑战。
-
企业AI演示因AI代理安全研究而失败
据估计,高达95%的企业AI项目未能从演示过渡到生产,原因是测试数据与真实环境之间存在差距。与此同时,AI代理领域的研究正在取得进展,出现了“MirrorCode”,并且关于AI安全和开发中“渐进式赋权削弱”的含义的争论仍在继续。