研究人员开发了一种新颖的基于梯度的语音到文本对齐方法,适用于任何可微分的自动语音识别(ASR)模型。该技术从令牌对数概率的梯度中提取词语时间信息,无需修改模型或进行训练。它提供了一种通用的对齐解决方案,适用于各种ASR家族,包括语音LLM,并直接在输入网格上进行对齐,以获得更高的时间精度。在读取语音和自发语音数据集上的十六个模型进行的评估表明,梯度对齐是可用的,其性能与原生对齐器相当,并为流式模型提供了改进,尽管它需要对每个令牌进行反向传播。 AI
影响 这项新的对齐技术有望提高各种模型架构下语音到文本系统的准确性和灵活性。
排序理由 该集群描述了一篇关于语音到文本对齐新颖方法的最新研究论文。
- arXiv
- ASR model
- Buckeye
- Hugging Face
- Speech LLMs
- TIMIT
- alphaXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →