一篇新的研究论文探讨了在自动化机器学习(AutoML)中划分数据集的方法,以确保更准确的模型评估。该研究将五种现有策略,包括随机划分和分层抽样,与Kennard-Stone、Duplex和SPXY等几何方法进行了比较。研究人员发现,几何方法可能由于接近零的相似度得分而导致性能估计不稳定。他们提出了一种新的“Optimised-Distribution”方法,该方法优先考虑统计相似性,达到了89.0%的平均MMD相似度得分,高于其他评估策略。 AI
影响 这项研究可能导致AutoML中更可靠的模型性能估计,尤其是在处理具有复杂分布的数据集时。
排序理由 arXiv上发表的研究论文,详细介绍了AutoML中数据集划分的新方法。
- chi-squared distribution
- Duplex
- Kennard-Stone
- Kolmogorov–Smirnov test
- Maximum Mean Discrepancy
- Optimised-Distribution
- SPXY
- University of California, Irvine
- Hugging Face
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →