研究人员开发了 SignLlama,这是一种通过优先考虑大型语言模型 (LLM) 的视觉特征来增强无手语翻译 (GFSLT) 的新方法。该方法解决了两个关键挑战:弥合 LLM 的视觉和文本输入之间的差距,以及防止模型过度强调文本而非视觉线索。SignLlama 引入了过滤伪手语 CTC 预训练来监督视觉骨干,以及一种视觉优先蒸馏策略,迫使模型仅依赖视觉输入来生成目标序列。实验表明,SignLlama 在 GFSLT 任务上取得了有竞争力的性能,而无需额外的模态或预训练数据集。 AI
影响 这项研究通过更好地将视觉数据与 LLM 集成,有可能提高手语翻译系统的准确性和可访问性。
排序理由 该集群包含一篇研究论文,详细介绍了使用 LLM 进行手语翻译的新方法。
- arXiv
- Filtered Pseudo-Gloss CTC Pretraining
- Gloss-Free Sign Language Translation
- large-language models
- SignLlama
- Visual-Prioritized Distillation
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →