PulseAugur
EN
LIVE 09:22:54

New dataset targets document-level post-editing in healthcare translation

Researchers have introduced the APEX-VW Corpus, a new dataset designed for document-level English-Spanish post-editing in the healthcare domain. This corpus is built from recent NHS virtual-ward documents and incorporates professional post-editing performed within Trados Studio, ensuring controlled machine translation, terminology, and quality assurance. Unlike previous sentence-level datasets, APEX-VW preserves document order and CAT-tool context, making it suitable for studying terminology normalization and correction propagation in realistic translation workflows. AI

IMPACT This dataset could advance research in machine translation post-editing and terminology normalization for specialized domains.

RANK_REASON The cluster contains a research paper introducing a new dataset. [lever_c_demoted from research: ic=1 ai=1.0]

Read on arXiv cs.CL →

AI-generated summary · Google Gemini · from 1 sources. How we write summaries →

New dataset targets document-level post-editing in healthcare translation

COVERAGE [1]

  1. arXiv cs.CL TIER_1 English(EN) · Marie Escribe, Tharindu Ranasinghe, Amal Haddad Haddad, Hansi Hettiarachchi, Damith Premasiri ·

    APEX-VW: A Document-Level English-Spanish Post-Editing Dataset in the Healthcare Domain

    arXiv:2608.08059v1 Announce Type: new Abstract: Post-Editing (PE) of Machine Translation (MT) output often involves repeating the same lexical and terminological corrections across many segments, especially in specialised and highly repetitive documents. Despite substantial work …