一篇研究论文提出,在遭受严重数据不平衡的自然语言处理任务中,可以使用Dice loss替代标准的交叉熵。该方法基于Sorensen-Dice系数或Tversky指数,旨在平衡假阳性和假阴性的重要性,使其对不平衡数据集更具鲁棒性。该论文还介绍了一种动态加权训练样本的方法,以减少易负例的影响,并在词性标注和命名实体识别等各种NLP任务上显示出改进的性能。 AI
影响 这项研究为提高具有不平衡数据集的NLP任务的模型性能提供了一种新颖的方法,有望在命名实体识别等领域带来更准确的系统。
排序理由 该项目是一篇关于NLP任务新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- CoNLL03
- cross entropy
- CTB5
- CTB6
- Dice loss
- natural language processing
- OntoNotes4.0
- OntoNotes5.0
- Sorensen-Dice coefficient
- Tversky index
- UD1.4
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →