研究人员开发了 EgoGazeLite,这是一种轻量级的设备上注视预测模型,旨在提高多模态大型语言模型 (MLLM) 在处理自注视视频输入时的效率。该模型通过预测注视点来裁剪相关区域,从而减少所需视觉 Token 的数量,以降低高分辨率视频相关的计算和内存成本。与依赖专用眼动追踪硬件的先前方法不同,EgoGazeLite 作为一种纯软件解决方案运行,适用于消费级智能眼镜和智能手机。该模型在多个 MLLM 和指标上的性能已得到验证,在描述质量方面与使用真实注视数据相比没有显著差异,并且能够实时运行。 AI
影响 能够更有效地在边缘设备上为 LLM 处理自注视视频,从而可能改进可穿戴技术的应用。
排序理由 该条目是一篇研究论文,详细介绍了一个新的 AI 模型及其技术规格。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →