研究人员推出了一种新颖的端到端方法——可提示注视目标估计(PGE),用于分析图像中的人类注视。与依赖多阶段流水线和显式输入的先前方法不同,PGE 使用自然语言或视觉提示来识别主体并预测注视目标。新推出的 GazeAnywhere 模型专为 PGE 构建,集成了主体定位和注视估计,在基准测试中取得了最先进的成果,并展示了其在临床应用中的潜力。此外,还发布了一个包含 120,000 个带提示注释的图像对的数据集 Gaze-Co,以支持这项任务。 AI
影响 这种新的注视估计方法可以改善人机交互,并在临床研究等领域实现更复杂的分析。
排序理由 该集群描述了一篇关于计算机视觉领域新任务、新模型和新数据集的最新研究论文。
在 Hugging Face Daily Papers 阅读 →
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- GazeAnywhere
- Gotit.pub
- Hugging Face
- Promptable Gaze Target Estimation
- ScienceCast
- CVPR 2026
- Promptable Gaze Target Estimation (PGE)
AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →