PulseAugur
实时 11:49:57
English(EN) Class-Structure Preservation Beats Diversity: A Comprehensive Benchmark of Text Augmentation Methods for Imbalanced Text Classification

在不平衡分类基准测试中,LLM文本增强效果不及经典方法

一项新的基准研究比较了不平衡文本分类的各种文本增强方法,评估了EmbSMOTE等经典技术和更新的基于LLM的方法。研究发现,LLM生成的数据在统计上等同于或劣于EmbSMOTE,并且随着类别不平衡的增加,性能差距会扩大。研究表明,类别条件结构保真度,而不是表面多样性,是有效增强的关键因素,并建议将检索式过采样作为默认方法。 AI

影响 表明当前基于LLM的文本增强可能不适用于不平衡数据集,建议改用经典方法。

排序理由 学术论文,展示了文本增强方法的基准测试和研究结果。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

在不平衡分类基准测试中,LLM文本增强效果不及经典方法

报道来源 [1]

  1. arXiv cs.CL TIER_1 English(EN) · Keito Inoshita ·

    类结构保持优于多样性:不平衡文本分类文本增强方法的全面基准测试

    arXiv:2608.12340v1 Announce Type: new Abstract: With the rapid advancement of large language models (LLMs), generative data augmentation has attracted considerable attention for imbalanced text classification in natural language processing. However, no empirical benchmark to date…