研究人员探讨了合成数据增强在语篇语用功能分类任务中的有效性,该任务常受数据稀缺的限制。通过使用Llama 3.1生成合成样本,并在RoBERTa嵌入空间中分析其与真实数据的接近程度,他们发现合成数据相对于决策边界的放置位置显著影响性能。虽然所有增强方法都比仅使用真实数据的基线有所改进,但邻近样本在宏观F1分数上带来了最大的提升,而平衡的混合样本则实现了最高的准确率。 AI
影响 这项研究表明,在表示空间中策略性地放置合成数据可以显著提高NLP模型的性能,尤其是在低资源任务中。
排序理由 该集群包含一篇研究论文,详细介绍了NLP任务数据增强的一种新颖方法。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Attention Signal
- British National Corpus
- command
- discourse marker
- Hugging Face
- interjection
- Llama 3.1
- natural language processing
- Roberta
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →