PulseAugur
EN
LIVE 09:59:23

Multilingual ASR model evaluated on Garrusi Kurdish

A new research paper analyzes the performance of the MMS-1B-all multilingual speech recognition model on Garrusi Kurdish, a variety of Kurdish written in Latin script. The study highlights challenges in evaluating speech recognition when the reference and hypothesis are in different writing systems, proposing a common-reference staged normalization approach to address this. Results indicate significant improvements in Word Error Rate (WER) and Character Error Rate (CER) after normalization, though substantial errors persist, suggesting limitations in both the recognition model and the scoring pipeline. AI

IMPACT This research highlights challenges in evaluating multilingual speech recognition models, particularly for under-resourced languages, and proposes normalization techniques that could improve future ASR development.

RANK_REASON The item is an academic paper published on arXiv detailing research into speech recognition models. [lever_c_demoted from research: ic=1 ai=1.0]

Read on arXiv cs.CL →

AI-generated summary · Google Gemini · from 1 sources. How we write summaries →

Multilingual ASR model evaluated on Garrusi Kurdish

COVERAGE [1]

  1. arXiv cs.CL TIER_1 English(EN) · Hiwa Asadpour ·

    Unadapted Multilingual ASR on a Garrusi Kurdish Evaluation Set: A Common-Reference Staged Normalization Analysis

    arXiv:2608.16379v1 Announce Type: new Abstract: Evaluating speech recognition for a Kurdish variety written in a Latin field orthography, using a model that outputs Arabic script, creates a measurement problem before a modelling one: direct scoring treats writing-system differenc…