一篇新发表在arXiv上的研究调查了低资源非洲语言合成数据选择方法的有效性。研究发现,普遍认为由LLM评估器高度评价的数据将提高下游模型性能的代理指标并不成立。在四种语言和两个任务中,基于LLM审计的数据质量排名与实际下游性能存在显著差异。该研究提出了一个反事实审计框架“V2”,它提高了评估标签的正确性,但仍不能保证下游效用,突显了合成数据评估需要在相同的保留集上报告审计和下游指标的必要性。 AI
影响 挑战了当前NLP中合成数据选择的方法,表明需要修订评估指标。
排序理由 关于NLP方法学的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →