PulseAugur
实时 16:55:02
实体 TIMIT

TIMIT

PulseAugur coverage of TIMIT — every cluster mentioning TIMIT across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 4 条
  1. SIGNIFICANT · CL_173165 ·

    CrisperWhisper 2.0 发布,支持逐字和意图转录模式

    Nyra Labs 发布了 CrisperWhisper 2.0,这是一款专为生产环境设计的高级语音转文本模型。该模型提供两种不同的模式:逐字转录模式,捕捉每一个口语细节;以及“意图”模式,提供清晰、易读的语音版本。CrisperWhisper 2.0 还具有精确的词级时间戳、对十种语言的多语言支持,以及无常见瑕疵地无缝处理长音频文件的能力。

  2. RESEARCH · CL_133172 ·

    新的基于梯度的语音到文本方法可跨所有ASR模型进行对齐

    研究人员开发了一种新颖的基于梯度的语音到文本对齐方法,适用于任何可微分的自动语音识别(ASR)模型。该技术从令牌对数概率的梯度中提取词语时间信息,无需修改模型或进行训练。它提供了一种通用的对齐解决方案,适用于各种ASR家族,包括语音LLM,并直接在输入网格上进行对齐,以获得更高的时间精度。在读取语音和自发语音数据集上的十六个模型进行的评估表明,梯度对齐是可用的,其性能与原生对齐器相当,并为流式模型提供了改进,尽管它需要对每个令牌进行反向传播。

  3. RESEARCH · CL_82097 ·

    新方法改进多语言词级语音对齐

    研究人员开发了一种新颖的多语言词级强制对齐方法,集成了Massively Multilingual Speech (MMS) 模型中的表示和一个自监督音素边界检测器。该方法使用学习型动态规划解码器来推断精确的词边界。该系统在TIMIT和Buckeye数据集上与Montreal Forced Aligner (MFA) 等现有方法相比,表现出优越的性能,并在未见过(unseen)的语言上显示出有希望的结果,表明其可扩展性可覆盖MMS支持…

  4. RESEARCH · CL_76811 ·

    新的声学模型在TIMIT语音识别上达到SOTA

    研究人员分析了用于TIMIT数据集语音识别的原始波形声学模型的错误模式。他们分解了跨语音类别的手机错误率(PER),并构建了混淆矩阵来理解替换错误。研究发现,他们的模型在TIMIT上的原始波形系统取得了最先进的结果,并且从WSJ迁移学习进一步提高了性能,尤其是在辅音方面。