PulseAugur
实时 02:48:18
实体 LLaVA-OneVision-7B

LLaVA-OneVision-7B

PulseAugur coverage of LLaVA-OneVision-7B — every cluster mentioning LLaVA-OneVision-7B across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 4
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 4 条
  1. TOOL · CL_208678 ·

    新的MemTree3D方法提高了3D问答效率

    研究人员开发了一种名为MemTree3D的新方法,用于在具身场景中进行更高效的3D问答。该方法使用一种紧凑、可重用的3D场景表示,使大型语言模型能够快速检索相关关键帧以进行查询,而无需处理整个视频流。MemTree3D系统提高了GPT-4o和LLaVA-OneVision-7B等模型在OpenEQA基准上的性能,优于现有的视觉搜索方法。

  2. TOOL · CL_183288 ·

    新的GSTEP框架修剪VideoLLM的token以提高效率

    研究人员开发了GSTEP,一个旨在提高视频大型语言模型(VideoLLMs)效率的新型修剪框架。与先前在片段内局部修剪token的方法不同,GSTEP将视频建模为连续的时空信息流。它通过结合时空信息来计算token级别的密度,从而实现全局token采样,平衡信息密度和覆盖范围。实验表明,GSTEP可以在保持高性能的同时修剪大部分视觉token,从而在不同模型和设置下改善准确性-效率的权衡。

  3. RESEARCH · CL_65854 ·

    新方法大幅削减VLM视觉Token,提升效率

    研究人员开发了三种新方法,可显著压缩大型视觉语言模型(VLM)使用的视觉Token,旨在降低计算开销并提高推理速度。InfoMerge利用时间指纹差异和内容感知分配,ETC采用任务感知视觉信息蒸馏,EvoCut分析多层Token演化。这些方法在Token数量上实现了大幅削减,其中一些在保持超过98%的原始性能的同时实现了显著的加速。

  4. RESEARCH · CL_47629 ·

    新框架和基准推动视频大模型效率和理解能力发展

    研究人员推出了一种名为EarlyTom的新框架,旨在通过在视觉编码器早期压缩视觉令牌来提高视频大语言模型(Video-LLMs)的效率。该方法在不牺牲准确性的前提下,显著降低了首个令牌生成时间(TTFT)和计算成本。同时,OmniPro和VideoOdyssey等新基准正在开发中,用于评估全模态模型在理解流式和长上下文视频数据方面的先进能力,以解决现有评估方法的局限性。