研究人员开发了一种名为顺序时空注意力网络(SSTAN)的新型基于 Transformer 的架构,用于动态手语和字母拼写识别。该模型利用分层、堆叠的空间和时间多头注意力机制,在不依赖预定义图结构的情况下捕获复杂时空模式。在 WLASL、JSL 和 KSL 等大型数据集上的实验表明,SSTAN 在具有挑战性的字母拼写类别中取得了最先进的性能,并在 WLASL 上的骨骼识别方法中建立了新的 SOTA,展示了其数据效率。 AI
影响 这项研究提高了手语识别能力,有望改善聋哑人群的交流工具。
排序理由 该集群包含一篇详细介绍新模型架构及其在特定基准测试中性能的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- Japanese Sign Language
- Koki Hirooka
- KSL-TV
- Sequential Spatio-Temporal Attention Network
- Spatial Multi-Head Attention
- SSTAN
- Stack Transformer
- Temporal MHA
- WLASL
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →