发布了一个新的、更高效的数据集 DeepSWE-mini,旨在复制完整 DeepSWE 基准测试的排名性能。该子集包含 16 个实例,可以对模型进行更快的本地测试和基准测试。目标是在保持更大基准测试中发现的相对性能排名的同时,提供一种更快的评估新模型的方法。 AI
影响 能够对语言模型进行更快、更高效的本地评估。
排序理由 该集群描述了一个用于基准测试的新数据集,属于研究范畴。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →