PulseAugur
实时 09:32:30
English(EN) Open-Vocabulary Gaze Object Prediction: Benchmark and Method

新的基准和方法推动开放词汇注视点目标预测

研究人员引入了一个名为“多样化场景注视点目标预测”(DiSG)的新基准,用于评估开放词汇注视点目标预测(OVGOP)。该任务旨在识别和识别人类正在查看的目标,即使这些目标不属于预定义的类别集。提出的框架使用文本驱动的目标发现和注视引导选择模块来寻找潜在目标。此外,一种称为梯度信息选择调优(GIST)的技术用于微调与特定词汇相关的模型参数,从而提高开放词汇和封闭词汇设置下的性能。 AI

影响 通过实现对未见过的物体类别的注视预测,提高了人工智能系统在现实场景中理解人类注意力和交互的能力。

排序理由 该集群描述了一篇介绍计算机视觉任务基准和方法的新学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的基准和方法推动开放词汇注视点目标预测

报道来源 [1]

  1. arXiv cs.CV TIER_1 English(EN) · Binglu Wang, Sensen Niu, Ying Chen, Guangyu Guo ·

    开放词汇注视目标预测:基准与方法

    arXiv:2607.18827v1 Announce Type: new Abstract: Gaze Object Prediction (GOP) aims to localize and recognize the objects humans attend to, a task crucial for understanding human-centric interactions. However, existing methods are typically trained under a closed-vocabulary paradig…