PulseAugur
实时 11:24:41
English(EN) A Multivariate Bernoulli-Based Sampling Method for Multi-Label Data with Application to Meta-Research

新的采样方法改善多标签数据平衡

提出了一种基于多变量伯努利分布的新采样方法,用于标签频率差异显著的多标签数据集。该新算法通过从观察到的标签频率估计分布参数并计算每个标签组合的权重来考虑标签依赖性。将该方法应用于标记有64个生物医学主题类别的研究文章样本,成功创建了一个更平衡的子样本,在保留整体频率顺序的同时,改善了不太常见类别的代表性。 AI

排序理由 学术论文,详细介绍了一种新的数据采样统计方法。[lever_c_demoted from research: ic=1 ai=0.4]

在 arXiv stat.ML 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的采样方法改善多标签数据平衡

报道来源 [1]

  1. arXiv stat.ML TIER_1 English(EN) · Simon Chung, Colby J. Vorland, Donna L. Maney, Andrew W. Brown ·

    面向多标签数据的多变量伯努利基础采样方法及其在元研究中的应用

    arXiv:2512.08371v4 Announce Type: replace-cross Abstract: Datasets may contain observations with multiple labels. If the labels are not mutually exclusive, and if the labels vary greatly in frequency, obtaining a sample that includes sufficient observations with scarcer labels to…