Researchers have developed a new method to control the transcription style of Automatic Speech Recognition (ASR) models, addressing issues of decoding instability and evaluation confounding caused by inconsistent verbatim vs. intended transcriptions. By training models with coverage-aware decoder task tokens on parallel verbatim and intended transcript pairs, they achieved significant improvements in German disfluency detection, even with English-only training. The approach also enhances word-level timing accuracy and introduces a new task called 'verbatimize' for creating high-quality verbatim transcriptions. AI
IMPACT Improves ASR accuracy and reliability, potentially impacting transcription services and voice interfaces.
RANK_REASON The cluster contains an academic paper detailing a new method for ASR models.
Read on Hugging Face Daily Papers →
- arXiv
- arXivLabs
- Computation and Language
- English
- German
- Hugging Face
- verbatim ASR
- word-level timing
- nyralabs
- nyralabs/CrisperWhisper2.0_medium
- Transcription Policy as a Latent Variable: Activating Controllable Verbatim ASR with Word-Level Timing
- Whisper
AI-generated summary · Google Gemini · from 3 sources. How we write summaries →