一种新的数据依赖有效性理论和去偏测试挑战了长期以来为解决机器学习中类别不平衡问题而制造合成少数类数据的做法。研究表明,合成数据通常是冗余或无效的,尤其是在类别重叠时,并且经典的验证方法存在缺陷。提出的去偏估计器能密切跟踪真实的无效性,揭示大多数方法未能提供显著的信息增益,甚至可能损害校准,这表明合成数据生成方法的证明责任发生了转移。 AI
影响 挑战了不平衡数据集数据增强的标准实践,可能导致更强大、更可靠的机器学习模型。
排序理由 学术论文,详细介绍了机器学习中合成数据有效性的新理论和测试。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- class-imbalanced learning
- DagsHub
- F1
- finance
- Gotit.pub
- Hugging Face
- IArxiv
- medicine
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →