一篇关于英语词义消歧(WSD)的新论文指出,当前前沿的LLM模型已经非常准确,以至于训练标签的质量已成为基准性能的主要瓶颈。研究人员引入了lexEN,一个修正后的WSD基准,以及SenseBench,一个带有排行榜的评估工具。他们还发布了重新标注的语料库和一个在这些改进标签上训练的强大双编码器模型,证明了生成高质量标签的成本现在是WSD研究的主要限制因素。 AI
影响 强调了随着LLM的进步,对高质量标记数据的关键需求,可能将研究重点转移到数据策展和标注效率上。
排序理由 该项目是一篇学术论文,详细介绍了一个特定NLP任务的新基准和评估方法。[lever_c_demoted from research: ic=1 ai=1.0]
- BEM
- English
- Fleiss' kappa
- Glite LENS
- lexEN
- Maru2022
- Raganato
- SemCor
- SenseBench
- WordNet
- word-sense disambiguation
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →