研究人员引入了一个名为“多样化场景注视点目标预测”(DiSG)的新基准,用于评估开放词汇注视点目标预测(OVGOP)。该任务旨在识别和识别人类正在查看的目标,即使这些目标不属于预定义的类别集。提出的框架使用文本驱动的目标发现和注视引导选择模块来寻找潜在目标。此外,一种称为梯度信息选择调优(GIST)的技术用于微调与特定词汇相关的模型参数,从而提高开放词汇和封闭词汇设置下的性能。 AI
影响 通过实现对未见过的物体类别的注视预测,提高了人工智能系统在现实场景中理解人类注意力和交互的能力。
排序理由 该集群描述了一篇介绍计算机视觉任务基准和方法的新学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- Diverse Scenes for Gaze object prediction (DiSG)
- Gradient-Informed Selection Tuning (GIST)
- Open-Vocabulary Gaze Object Prediction (OVGOP)
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →