PulseAugur
实时 06:54:28
English(EN) Scaling Unsupervised Word Alignment to Documents via Structural Constraints

新的CTFAlign方法改进了跨文档的无监督词对齐

研究人员开发了CTFAlign,一种用于跨整个文档的无监督词对齐的新方法,它改进了句子级对齐技术。该方法采用粗粒度到细粒度的策略,将搜索空间缩小到语义相似的区域,另一种方法MDPAlign通过位置约束对齐。这两种方法都直接在完整文档上操作,无需句子分割,并在各种语言对中证明了词对齐错误率从0.412降低到0.326。对齐精度的提高也带来了下游任务(如文档级翻译覆盖率评估)性能的提升。 AI

影响 这项研究可以通过在长文档中实现更准确的词对齐来增强跨语言NLP任务,从而可能改进机器翻译和信息检索。

排序理由 关于词对齐新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的CTFAlign方法改进了跨文档的无监督词对齐

报道来源 [1]

  1. arXiv cs.CL TIER_1 English(EN) · Michelle Wastl, Jannis Vamvas, Rico Sennrich ·

    通过结构化约束将无监督词对齐扩展到文档

    arXiv:2608.21023v1 Announce Type: new Abstract: Word alignment has traditionally been studied between sentences, but many cross-lingual tasks increasingly require correspondences across full documents. While recent multilingual embedding models can encode long inputs, we show tha…