实体
W2V-BERT 2.0
W2V-BERT 2.0
PulseAugur coverage of W2V-BERT 2.0 — every cluster mentioning W2V-BERT 2.0 across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 3 条
-
研究发现:低资源ASR评估需要多种子测试
一项关于喜马拉雅地区低资源语言Garhwali的自动语音识别(ASR)的新研究,强调了可复现的多种子评估的重要性。研究人员发现,先前归因于Focal CTC或matra-加权目标等特定目标的改进,在跨多个随机种子测试时并不稳健。相反,采用标准CTC的W2V-BERT 2.0模型达到了具有竞争力的47.0%词错误率(WER),这表明对于此类方言,预训练设计比模型大小更关键。
-
DONDO:为 27 种非洲语言发布开源 ASR 模型
研究人员推出了 DONDO,这是一系列专为非洲语言设计的开源自动语音识别 (ASR) 模型。这些模型基于 w2v-BERT 2.0 架构构建,包含 21 个单语版本和 5 个多语版本,覆盖六个国家的 27 种语言变体。这些模型使用宗教文本进行了微调,并采用了一种新颖的语言条件机制,在多语种家族的平均词错误率方面达到了 10-13%。所有 DONDO 模型均可在 Hugging Face 上以 Apache-2.0 许可证提供,可免费用…
-
新的自适应模态路由提高了说话人识别的准确性
研究人员开发了一种自适应模态路由(AMR)系统,以提高多模态说话人识别的性能,尤其是在模态缺失或语言不匹配等具有挑战性的实际条件下。AMR系统动态评估输入质量,并整合来自音频和面部嵌入的信息。在POLY-SIM 2026挑战数据集上的实验结果表明,该系统在各种协议下均表现出高准确性,显著优于基线融合方法。