PulseAugur
实时 09:23:20
English(EN) SignLlama: Enhancing Gloss-free Sign Language Translation by Prioritizing Visual Features for LLMs

SignLlama 通过优先考虑 LLM 的视觉特征来增强手语翻译

研究人员开发了 SignLlama,这是一种通过优先考虑大型语言模型 (LLM) 的视觉特征来增强无手语翻译 (GFSLT) 的新方法。该方法解决了两个关键挑战:弥合 LLM 的视觉和文本输入之间的差距,以及防止模型过度强调文本而非视觉线索。SignLlama 引入了过滤伪手语 CTC 预训练来监督视觉骨干,以及一种视觉优先蒸馏策略,迫使模型仅依赖视觉输入来生成目标序列。实验表明,SignLlama 在 GFSLT 任务上取得了有竞争力的性能,而无需额外的模态或预训练数据集。 AI

影响 这项研究通过更好地将视觉数据与 LLM 集成,有可能提高手语翻译系统的准确性和可访问性。

排序理由 该集群包含一篇研究论文,详细介绍了使用 LLM 进行手语翻译的新方法。

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

SignLlama 通过优先考虑 LLM 的视觉特征来增强手语翻译

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Shiwei Gan, Xiao Liu, Yafeng Yin, Zhiwei Jiang, Bowen Guo, Lie Xie, Sanglu Lu, Hongkai Wen ·

    SignLlama:通过优先考虑LLM的视觉特征来增强无注音手语翻译

    arXiv:2608.09006v1 Announce Type: cross Abstract: Large Language Models (LLMs) have achieved remarkable success across a wide range of tasks. However, fine-tuning LLMs for Gloss-Free Sign Language Translation (GFSLT) remains a challenge. In this paper, we investigate how to effec…