一个扩展了CruxEval的新基准已被开发出来,用于评估AI模型预测真实世界程序最终输出和内部状态的能力。该基准包含来自371个Python和C++程序的400个案例,并在各种模型系列中进行了测试。结果表明,具有推理能力的模型显著优于不具备推理能力的模型,在最终输出预测方面取得了高精度,并证明了该基准在暴露错误方面的有效性。 AI
影响 该基准有望催生更强大的AI模型,使其能够理解和预测程序执行,从而改进代码分析和生成工具。
排序理由 该集群描述了一篇介绍AI模型评估基准的新学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX Code Finder for Papers
- CORE Recommender
- CPP
- CruxEval
- DagsHub
- Gotit.pub
- Hugging Face
- Influence Flower
- Python
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →