PulseAugur
实时 08:40:19
English(EN) A Factorial Study of Synthetic Data Generation for Low-Resource Machine Translation using Grammar Books

新流程为低资源机器翻译生成合成数据

研究人员开发了一个新流程,通过从语法书中提取语法规则和例句,为低资源机器翻译生成合成平行语料库。该方法在三种不同的语言上进行了测试:Kalamang(巴布亚语系)、Tuatschin(罗曼语族)和Mandan(苏语族)。使用这些合成数据进行的微调过程显示出翻译质量的提高,ChrF++得分在Kalamang上最高可达+8.8,在Tuatschin上为+5.3,在Mandan上为+3.3。因子研究确定了影响这些提高的关键因素,展示了一种为严重资源匮乏的语言创建翻译工具的实用方法。 AI

影响 通过重新利用语言学文献,为濒危语言的翻译工具开发提供了可能。

排序理由 该项目是一篇学术论文,详细介绍了一种用于机器翻译的合成数据生成新方法。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新流程为低资源机器翻译生成合成数据

报道来源 [1]

  1. arXiv cs.CL TIER_1 English(EN) · Varun Ghat Ravikumar, Sina Ahmadi, Lena J\"ager, Rico Sennrich ·

    A Factorial Study of Synthetic Data Generation for Low-Resource Machine Translation using Grammar Books

    arXiv:2607.22376v1 Announce Type: new Abstract: Most endangered languages lack the parallel data required for machine translation, despite the existence of descriptive grammar books. We introduce a pipeline that uses large language models to extract grammatical rules, example sen…