PulseAugur
实时 12:02:24
English(EN) EgoGazeLite: On-Device Egocentric Gaze Prediction for Token-Efficient Multimodal LLM Video Input

新型 AI 模型实现 LLM 的高效自注视视频分析

研究人员开发了 EgoGazeLite,这是一种轻量级的设备上注视预测模型,旨在提高多模态大型语言模型 (MLLM) 在处理自注视视频输入时的效率。该模型通过预测注视点来裁剪相关区域,从而减少所需视觉 Token 的数量,以降低高分辨率视频相关的计算和内存成本。与依赖专用眼动追踪硬件的先前方法不同,EgoGazeLite 作为一种纯软件解决方案运行,适用于消费级智能眼镜和智能手机。该模型在多个 MLLM 和指标上的性能已得到验证,在描述质量方面与使用真实注视数据相比没有显著差异,并且能够实时运行。 AI

影响 能够更有效地在边缘设备上为 LLM 处理自注视视频,从而可能改进可穿戴技术的应用。

排序理由 该条目是一篇研究论文,详细介绍了一个新的 AI 模型及其技术规格。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新型 AI 模型实现 LLM 的高效自注视视频分析

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Matteo Stoiber, Niels Buus Lassen ·

    EgoGazeLite:用于令牌高效多模态大语言模型视频输入的设备上自注视预测

    arXiv:2608.15614v1 Announce Type: cross Abstract: The use of multimodal LLMs (MLLMs) for egocentric video understanding with wearable devices is constrained by the token budget. Memory and compute cost scale with the number of visual tokens, and high-resolution video quickly beco…