一篇新发表在arXiv上的论文认为,当前聚合性能得分的机器学习基准测试未能捕捉到模型独特的优势。作者提出了一个“以数据为中心的峰值性能前沿”来识别对特定数据集不可替代的模型。他们对TabArena基准的分析表明,聚合指标偏好一致性而非独特能力,可能忽略了具有专业优势的模型。 AI
影响 这项研究表明需要更细致的评估指标,以识别超越聚合性能的专业模型能力。
排序理由 该条目是一篇讨论机器学习模型评估方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- IArxiv
- Influence Flower
- ScienceCast
- TabArena
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →