在机器学习模型中分箱连续变量,例如将年龄划分为离散类别,会显著降低模型的预测能力。研究表明,即使是简单的中位数分割也会丢弃数据集中约36%的信息。这种做法会在存在平滑关系的地方产生人为的不连续性,可能导致模型性能不佳和可利用的决策边界。 AI
影响 通过丢弃有价值的信息降低模型准确性,可能导致次优预测和可利用的决策边界。
排序理由 该项目讨论了关于一种常见数据预处理技术的 istatistical 分析和研究结果。
- Altman
- Applied Psychological Measurement
- Jacob Cohen
- NumPy
- Pandas
- Royston
- Sauerbrei
- scikit-learn
- Statistics in Medicine
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →