一项新的基准研究比较了不平衡文本分类的各种文本增强方法,评估了EmbSMOTE等经典技术和更新的基于LLM的方法。研究发现,LLM生成的数据在统计上等同于或劣于EmbSMOTE,并且随着类别不平衡的增加,性能差距会扩大。研究表明,类别条件结构保真度,而不是表面多样性,是有效增强的关键因素,并建议将检索式过采样作为默认方法。 AI
影响 表明当前基于LLM的文本增强可能不适用于不平衡数据集,建议改用经典方法。
排序理由 学术论文,展示了文本增强方法的基准测试和研究结果。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →