PulseAugur
实时 06:48:03
English(EN) When Does More Correct Data Hurt? Insertion-Stability and the Limits of Dimension-Based Theory

新研究表明正确数据会损害机器学习模型性能

研究人员发现了一种现象,即向训练集中添加正确数据会适得其反地损害机器学习模型的性能。当一个单调的对手附加更多正确标记的示例时,就会发生这种情况,这可能会导致模型的错误率超出干净数据所预期的水平。该研究引入了学习器的插入稳定性概念,该概念保证了对这种对手的免疫力,确保额外的正确数据只会提高或保持性能。研究强调,学习算法与数据类别之间的匹配度对于避免这些负面影响至关重要。 AI

影响 这项研究通过识别数据增强可能产生不利影响的条件,有可能带来更强大的机器学习算法。

排序理由 详细介绍机器学习理论发现的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv stat.ML 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新研究表明正确数据会损害机器学习模型性能

报道来源 [1]

  1. arXiv stat.ML TIER_1 English(EN) · Joseph Sankoorikal Johny ·

    更多正确数据何时会适得其反?插入稳定性与基于维度的理论的局限性

    arXiv:2608.14020v1 Announce Type: cross Abstract: Adding data known to be correct ought to be safe. Not always. Larsen, Pabbaraju and Shetty model the failure with a monotone adversary, which reads an i.i.d. training sample and may append as many further examples as it likes, pro…