研究人员推出了一项名为手语问答(SLQA)的新任务,以更好地评估超越简单识别或翻译的手语理解能力。该任务要求模型回答关于手语视频的自然语言问题,评估更广泛的推理能力。为了支持SLQA,创建了两个基准数据集SignQA,使用了PHOENIX14T和CSL-Daily,包含五类(如位置推理和视觉搜索)的问答对。还提出了一个包含问答条件调制时间降采样模块的基线模型,该模型在这些基准上的表现优于现有的视觉语言模型。 AI
影响 引入了对手语模型更全面的评估,可能推动理解和可访问性的进步。
排序理由 该集群描述了一篇介绍手语理解新任务、基准和基线模型的新学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- CSL-Daily
- PHOENIX14T
- Question-Conditioned Modulated Temporal Downsampling
- Sign Language Question Answering
- SignQA
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →