PulseAugur
实时 09:49:13
实体 LLaVA-Video

LLaVA-Video

PulseAugur coverage of LLaVA-Video — every cluster mentioning LLaVA-Video across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 2 条
  1. RESEARCH · CL_227216 ·

    新方法压缩视频以用于多模态大语言模型,保持性能

    两篇新研究论文提出了用于多模态大语言模型(MLLMs)的视频数据压缩方法。第一篇论文《视觉令牌编码》(VTC)借鉴经典视频编码原理,预测帧并衡量冗余,在Qwen3-VL上实现了100.1%的性能保留,令牌预算为50%。第二篇论文《令牌预算蒸馏》(TBD)采用双路径师生设计,将全令牌语义迁移到压缩视频的VLMs,在LLaVA-Video上以10%的令牌预算保持了97.0%的准确率。这两种方法都旨在降低处理MLLMs视频输入的计算成本,同…

  2. RESEARCH · CL_167440 ·

    新框架通过自适应帧处理提升 MLLM 长视频理解能力 · 跟踪 3 个来源

    三篇新研究论文介绍了增强多模态大语言模型(MLLM)长视频理解能力的新型框架。这些方法旨在通过自适应地选择和处理相关视频帧来克服固定上下文窗口的限制。ReMem 专注于解析问题的时序粒度并将帧与查询语义对齐,而 CADER 则动态推理证据置信度,绕过对简单问题的不必要处理。GenEvA 将选定的帧聚合为潜在证据表示,以最小的开销提高性能。