研究人员发现,当前评估合成表格数据的方法在保存列间依赖性方面存在显著差距。标准指标常常无法检测到这些关键依赖性的丢失,导致对数据保真度的评估不准确。该研究引入了一种新的诊断工具 XGB-C2ST,它将分类器的双样本检验分解为边际、依赖性和交叉分量分析。将其应用于 TabbyFlow/EF-VFM 生成器后,揭示了一个持续存在的“依赖性差距”,该差距对少数类效用产生负面影响,而现有评估方法未能发现这一缺陷。 AI
影响 突出了合成数据评估中的一个关键缺陷,可能影响在此类数据上训练的 AI 模型的可靠性。
排序理由 该条目是一篇学术论文,详细介绍了一种评估合成数据的新方法。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX Code Finder for Papers
- Connected Papers
- DagsHub
- EF-VFM
- Gotit.pub
- Hugging Face
- Influence Flower
- Litmaps
- ScienceCast
- scite Smart Citations
- TabbyFlow
- XGB-C2ST
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →