一篇新研究论文发布在 arXiv 上,该论文解决了用于评估机器翻译质量的 COMET 指标中存在的显著偏差。研究发现,COMET 分数很大程度上受到目标语言书写系统的影响,而不仅仅反映翻译的准确性。这种由书写系统引起的偏差占了 COMET 分数方差的很大一部分,并对其与不同指示性语言的人工标注者的一致性产生了负面影响。研究人员提出了一种名为 COMET-QN 的方法来规范跨书写系统的分数,并提供了诊断工具来识别和量化这种偏差,主张在报告评估结果时提高透明度。 AI
影响 突出了一个广泛使用的机器翻译评估指标中的关键缺陷,可能影响机器翻译的未来研究和开发,尤其是在多语言环境中。
排序理由 发布在 arXiv 上的研究论文,详细介绍了一种新的机器翻译评估指标的诊断和纠正方法。 [lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →