A new research paper explores methods for splitting datasets in automated machine learning (AutoML) to ensure more accurate model evaluation. The study compares five existing strategies, including random splitting and stratified sampling, against geometric methods like Kennard-Stone, Duplex, and SPXY. Researchers found that geometric approaches can lead to instability in performance estimates due to near-zero similarity scores. They propose a new 'Optimised-Distribution' method that prioritizes statistical similarity, achieving an 89.0% mean MMD similarity score, which is higher than other evaluated strategies. AI
IMPACT This research could lead to more reliable model performance estimates in AutoML, particularly for datasets with complex distributions.
RANK_REASON Research paper published on arXiv detailing new methods for dataset splitting in AutoML.
- chi-squared distribution
- Duplex
- Kennard-Stone
- Kolmogorov–Smirnov test
- Maximum Mean Discrepancy
- Optimised-Distribution
- SPXY
- University of California, Irvine
- Hugging Face
AI-generated summary · Google Gemini · from 2 sources. How we write summaries →