研究人员推出Gazette,一个新颖的框架,用于将人类视线解码为描述目标的自然语言。与依赖分类解码的先前方法不同,Gazette使用多模态大型语言模型(MLLMs)生成自由形式文本,捕捉人类意图的细微差别。该框架利用大型语言模型生成的合成“出声思考”记录,帮助Gazette学习目标特定动态并过滤个体视线差异。这种方法在各种任务的视线解码中取得了最先进的性能,使视线能够作为推断人类目标的非侵入性线索。 AI
影响 这项研究可能通过使系统能够通过视线跟踪更好地理解用户意图,从而实现更直观的人机交互。
排序理由 该集群描述了在arXiv上的一篇学术论文中提出的新颖框架和学习问题。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Hugging Face
- large language model
- Multimodal Large Language Models and Tunings: Vision, Language, Sensors, Audio, and Beyond
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →