PulseAugur
实时 04:06:10
English(EN) Gaze-to-text Generation: Beyond Categorical Decoding of Human Attention

新的视线到文本框架使用LLM解码人类意图

研究人员推出Gazette,一个新颖的框架,用于将人类视线解码为描述目标的自然语言。与依赖分类解码的先前方法不同,Gazette使用多模态大型语言模型(MLLMs)生成自由形式文本,捕捉人类意图的细微差别。该框架利用大型语言模型生成的合成“出声思考”记录,帮助Gazette学习目标特定动态并过滤个体视线差异。这种方法在各种任务的视线解码中取得了最先进的性能,使视线能够作为推断人类目标的非侵入性线索。 AI

影响 这项研究可能通过使系统能够通过视线跟踪更好地理解用户意图,从而实现更直观的人机交互。

排序理由 该集群描述了在arXiv上的一篇学术论文中提出的新颖框架和学习问题。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的视线到文本框架使用LLM解码人类意图

报道来源 [1]

  1. arXiv cs.CV TIER_1 English(EN) · Sounak Mondal, Dimitris Samaras, Gregory Zelinsky, Minh Hoai ·

    视线到文本生成:超越人类注意力的分类解码

    arXiv:2607.23917v1 Announce Type: new Abstract: We introduce a novel learning problem: decoding gaze into natural language descriptions of human goals across diverse visual tasks. Unlike prior work, which frames gaze decoding as a discriminative task over predefined categories, w…