Video LLMs
PulseAugur coverage of Video LLMs — every cluster mentioning Video LLMs across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
华为 IJCAI 2026 论文聚焦 AI 模型效率提升 · 追踪 1 个来源
华为在 IJCAI-ECAI 2026 上发表了四篇论文,将重点从扩大模型规模转向优化效率和设计。其中一篇论文详细介绍了一个分层 Vision Transformer (ViT),该模型扩展到 300 亿参数,通过重新设计架构和训练策略,以更少的激活参数实现了高精度。另一篇论文为视频大语言模型 (Video-LLMs) 引入了一个可学习帧选择器 (LFS),该选择器智能地选择关键帧以降低计算成本并提高视频描述准确性。第三篇论文提出 R…
-
新的SlotNarrative接口提高了视频-LLM的令牌效率
研究人员推出了一种名为SlotNarrative的新型接口,旨在提高视频大型语言模型(Video-LLMs)的令牌效率。该系统使用紧凑的对象状态令牌将视频组织成持久化对象叙事,这些令牌代表对象在不同片段中的身份及其状态(外观、几何形状、可见性、轨迹)。与之前压缩逐帧特征的方法不同,SlotNarrative首先将视觉特征分组到类似对象的槽中,然后通过无参数内存将重复的观察与剪辑级条目关联起来。这种方法为冻结的Video-LLM分配了固…
-
两种新方法解决视频LLM令牌压缩以提高效率
两篇新的研究论文提出了用于压缩视频大型语言模型(Video-LLM)中视频令牌的新颖方法,以提高效率。第一篇论文介绍了NovaCov,这是一种为流媒体视频设计的集合式令牌压缩器,它使用历史参考库和双分支子模覆盖目标来保留代表性内容,同时将LLM预填充延迟降低46%。第二篇论文提出了ONCE,一个离线学习频率感知全局码本的框架,并将其用于轻量级在线压缩,显著降低了每视频的计算量和推理延迟。
-
新的PhyCheck数据集评估视频大语言模型对物理定律的理解
研究人员推出了PhyCheck,这是一个旨在评估和改进视频大语言模型(VideoLLMs)物理定律理解能力的新数据集。该数据集包含粗粒度和细粒度子集,用于评估模型是否能识别物理定律的违规行为以及导致这些违规行为的具体细节。使用PhyCheck数据对Qwen2.5-VL进行微调的实验表明,物理一致性有了显著提高,尽管当前模型在整合额外的因果背景方面仍存在困难。
-
Video-HOCA基准揭示视频大语言模型在异常解释方面存在困难
引入了一个名为Video-HOCA的新诊断基准,用于评估视频大语言模型(Video-LLMs)的物理异常推理能力。该基准利用本体因果分类法,包含1400多个视频和3470多个经人工验证的问答对。对20个指令模式Video-LLMs的初步测试显示,虽然识别任务得分约为75-88%,但解释任务(任务II)的宏观F1得分大多低于50%,表明在识别异常和解释异常之间存在显著差距。
-
新基准诊断视频大语言模型的视觉基础能力
一篇新论文引入了视觉依赖差距(VDG)来评估视频大语言模型(LLMs)的视觉基础能力。VDG衡量了模型处理原始视频和黑屏时的准确率差异,揭示了许多模型的性能提升并非源于视觉理解,而是帧多样性。研究发现,时间推理对准确率的贡献很小,即使稳定的聚合准确率也可能掩盖重大的问题级别答案翻转。VDG被提议作为评估视频大语言模型视觉基础能力的标准审计。
-
新的E-VQA任务旨在提高视频LLM的透明度
研究人员推出了一种名为证据支持视频问答(E-VQA)的新任务,旨在提高视频大语言模型(Video LLM)的透明度。目前的模型通常在没有明确视觉依据的情况下提供答案,现有的可解释性方法也有限。E-VQA要求模型同时输出语义答案和精确的时空证据,例如时间段和对象掩码。为了支持这一点,创建了一个名为ST-Evidence的新基准,以及一个名为ST-Evidence-Instruct的大规模数据集,用于训练模型进行细粒度的视觉基础定位。
-
新的SLVMBench基准测试揭示视频大语言模型在从长记忆中学习技能方面存在困难
研究人员推出了SLVMBench,这是一个新颖的基准测试,旨在评估视频大语言模型(video-LLMs)从扩展视频记忆中学习技能并在实时场景中应用它们的能力。该基准测试通过在数小时的不相关内容中嵌入教程视频来模拟人类学习,测试模型记忆、提取程序性知识并将其转移到正在进行的任务中的能力。初步评估表明,当前的视频大语言模型在这一过程中存在显著困难,特别是当所需知识嵌入在长视频上下文中时,这凸显了它们在技能获取和应用能力方面的一个关键限制。
-
GeoTrace框架压缩视频令牌,以提高视频大语言模型的效率
研究人员推出GeoTrace,一个新颖的框架,旨在通过压缩视频令牌来提高视频大语言模型(Video LLMs)的效率。这种无需训练的方法使用上下文最远点锚定和轨迹约束残差凝结,将视频证据分解为骨架和残差事件令牌。GeoTrace已在各种Video LLMs和基准测试中证明了其有效性,在保持高性能的同时显著降低了计算负载。
-
TimeThink框架增强视频大语言模型的时间推理能力 · arXiv论文
研究人员推出TimeThink,一个新颖的强化学习框架,旨在增强视频大语言模型(Video-LLMs)的时间推理能力。该方法通过将时间线索步骤视为核心优化原语,专注于优化长视频序列中相关时间证据的发现。TimeThink利用分步时间过程奖励进行局部信用分配,并结合过程-结果优化目标来提高推理准确性和任务正确性。该框架得到了TimeThink-RFT-20K数据集的支持,该数据集包含自动提取的时间证据片段,并在各种视频理解基准测试中展示…
-
去噪注意力(DnA)提升视觉任务性能
研究人员推出了一种名为去噪注意力(DnA)的新方法,旨在提高基于注意力模型的视觉任务性能。DnA通过使用正负查询分别识别相关和不相关的图像特征,解决了标准softmax激活产生的噪声注意力模式问题。该方法将交互投影到不同的子空间,增强了特征的可辨别性。当应用于Vision Transformer Base (ViT-B)骨干网络时,DnA在ImageNet-1K上实现了0.8%的绝对增益,并在视频理解任务(包括视频Transforme…
-
新基准和框架提升视频时序定位能力
研究人员为改进长视频中的时序定位引入了新的基准和框架。一项研究认为,小时级视频定位主要是一个搜索问题,而非识别问题,并发布了ExtremeWhenBench基准来支持这一观点。另一种方法TaRO通过时间感知和新颖的奖励系统来优化其推理过程,从而增强多模态大语言模型。第三种方法CACR利用候选选择和因果推理,在教学视频时序定位任务上取得了最先进的性能。
-
新的MACD方法可解决视频大语言模型幻觉问题
研究人员开发了一种名为模型感知对比解码(MACD)的新推理策略,以解决视频语言模型中的幻觉问题。MACD利用模型自身的反馈来识别和定位导致生成无根据内容的特定对象区域。通过创建针对这些问题区域的反事实输入,MACD在解码过程中强制执行基于证据的标记选择,从而减少幻觉并提高在各种基准测试上的准确性。
-
新框架使用属性分析来衡量视频-LLM的复杂度
研究人员推出了一种名为VideoABC的新框架,旨在衡量视频-LLM的视频-问题对的复杂度。这种非参数度量利用视频属性词汇表,例如场景复杂度和事件速度,来估计视频-LLM在给定输入上失败的概率。VideoABC结合了k-means和通用格量化器,以确保即使在参考数据有限的情况下也能进行准确的估计和泛化。实验表明,该方法在性能上优于其他方法,同时提供了对基准复杂度可解释的见解。
-
V-LynX框架将新模态集成到视频大语言模型中
研究人员开发了V-LynX,一个通过利用现有令牌接口将新模态集成到视频大语言模型(LLMs)中的框架。该方法使用一个轻量级的辅助路径和非配对数据,将新的感官输入与视频先验知识对齐,避免了对大量特定模态编码器或配对监督的需求。V-LynX在各种视频理解任务中展示了最先进的性能和效率,包括视听问答和多视图视频理解。
-
LiteFrame 提升视频大语言模型帧扩展能力并降低延迟
研究人员开发了 LiteFrame,这是一种高效的视觉编码器,旨在提高视频大语言模型(Video LLMs)在处理扩展视频内容时的性能。该新框架使用压缩令牌蒸馏来训练一个紧凑的编码器,该编码器模仿大型模型的输出,从而降低了计算开销。与现有的 InternVL3-8B 等模型相比,LiteFrame 在处理八倍帧数的同时将延迟降低了 35%,并提高了视频理解基准的准确性。
-
新的CRPO方法增强了视频大语言模型的时空敏感性
研究人员开发了一种名为反事实关系策略优化(CRPO)的新框架,以提高视频大语言模型(Video LLMs)的时空敏感性。该方法解决了Video LLMs依赖捷径而非准确跟踪视频动态的问题。CRPO采用双分支强化学习方法,并引入了新颖的反事实关系奖励(CRR),鼓励模型在视觉上下文改变时改变答案,从而防止依赖静态线索。
-
研究发现视频大语言模型存在运动方向感知障碍
研究人员发现当前视频大语言模型(Video-LLMs)存在一个显著的局限性,称为“运动方向感知障碍”,即模型难以准确感知和表述物体运动的方向。尽管运动方向信息存在于模型的内部状态中,但一个“方向绑定缺口”阻止了其与语言输出的正确关联。为解决此问题,研究人员开发了MoDirect数据集用于微调和评估,以及一种新颖的目标函数DeltaDirect,该函数在合成基准测试中将运动方向准确率从接近随机水平提高到85%以上,在真实世界数据上提高了…
-
新框架和基准推动视频大模型效率和理解能力发展
研究人员推出了一种名为EarlyTom的新框架,旨在通过在视觉编码器早期压缩视觉令牌来提高视频大语言模型(Video-LLMs)的效率。该方法在不牺牲准确性的前提下,显著降低了首个令牌生成时间(TTFT)和计算成本。同时,OmniPro和VideoOdyssey等新基准正在开发中,用于评估全模态模型在理解流式和长上下文视频数据方面的先进能力,以解决现有评估方法的局限性。
-
研究发现 Video-LLM 在时间信息流方面存在困难
研究人员发现,视频大型语言模型(Video-LLMs)在处理时间信息方面存在一个重大的瓶颈,这阻碍了它们理解视频播放方向的能力。虽然以视频为中心的编码器可以有效地捕捉时间信号,但标准的 Video-LLM 架构通常无法可靠地传递这些信息。研究强调,投影层是一个关键组成部分,某些设计会破坏时间数据,而保留时间的 MLP 投影可以改善信息流。通过优化编码器、投影器并纳入特定的监督,一个新的 Video-LLM 在时间推理任务上达到了接近人类的准确率。