研究人员开发了TEAMMix,一个旨在利用基于LLM的数据增强来增强分层文本分类(HTC)的新型框架。该方法通过关键词生成和语料库挖掘来语义丰富标签层级,解决了复杂的标签层级和类别不平衡等挑战。然后,它使用LLM生成伪样本来对抗长尾问题,并采用基于高斯混合模型的置信度重采样来提高数据质量。实验表明,TEAMMix能有效提升LLM生成标签的可靠性,并显著提高在细粒度和不平衡数据集上的分类性能。 AI
影响 这项研究为提高LLM在分层文本分类任务中的性能提供了一种新方法,尤其是在处理不平衡数据集方面。
排序理由 该集群包含一篇详细介绍文本分类新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →