PulseAugur
实时 23:53:25
实体 LLaVA-onevision

LLaVA-onevision

PulseAugur coverage of LLaVA-onevision — every cluster mentioning LLaVA-onevision across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 6
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 6
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 6 条
  1. RESEARCH · CL_139317 ·

    GeoTrace框架压缩视频令牌,以提高视频大语言模型的效率

    研究人员推出GeoTrace,一个新颖的框架,旨在通过压缩视频令牌来提高视频大语言模型(Video LLMs)的效率。这种无需训练的方法使用上下文最远点锚定和轨迹约束残差凝结,将视频证据分解为骨架和残差事件令牌。GeoTrace已在各种Video LLMs和基准测试中证明了其有效性,在保持高性能的同时显著降低了计算负载。

  2. RESEARCH · CL_128851 ·

    新方法逐个标记追踪多模态大语言模型注意力

    研究人员开发了一种名为“逐个标记”(OTaT)的新方法,用于分析多模态大语言模型(MLLMs)在响应生成过程中如何利用视觉和文本信息。该技术追踪对图像、文本、指令和先前生成标记的注意力转移,揭示了各种MLLMs之间的一致模式。研究发现,当需要图像派生信息时,对图像的注意力达到峰值;在任务转换期间会重新审视指令;随着时间的推移,对生成标记的注意力会增加。基于这些发现的干预措施显著提高了多模态任务的性能。

  3. TOOL · CL_121209 ·

    新框架提升大语言模型高分辨率图像感知能力

    研究人员推出了一种名为分层实体探索(HEE)的新型框架,旨在增强多模态大语言模型(MLLMs)的高分辨率图像感知能力。与需要大量训练或依赖固定图像分割的现有方法不同,HEE无需训练且模型无关。它通过首先评估区域是否有足够证据,然后使用对象检测进行细粒度细节分析,并将这些信息组织成语义层次结构,来动态指导实体探索。该方法旨在通过置信度引导的回溯实现自适应感知,从而克服当前高分辨率图像处理中常见的细节丢失问题。

  4. RESEARCH · CL_117463 ·

    新框架通过保留知识和改进生成来增强多模态AI

    研究人员正在开发新框架以增强多模态AI模型。Rosetta 引入了一种可组合的预训练方法,可以在不破坏现有知识的情况下添加新模态并保留核心知识,使用动量锚定正交投影来管理梯度冲突。COMPASS 在统一系统中将组合意图控制进行接地,通过使用共享的专家令牌来同时改进感知和生成。SRUM 使统一的多模态模型能够通过使用其理解模块作为内部评估器来改进其生成能力,采用双重奖励系统来保证全局和局部保真度。此外,ReVisIT 提供了一种无需训练…

  5. RESEARCH · CL_107765 ·

    新方法通过高效内存和重看能力增强流媒体视频理解 · 跟踪 6 个来源

    研究人员开发了新方法,在严格的计算和内存限制下提高流媒体视频理解 (SVU) 能力。ProtoKV 是一种新颖的内存系统,将旧视频内容聚合为摘要状态,在延迟查询场景下准确率提高高达 12.5 个百分点。另外,video-SALMONN-R$^3$ 使用重看机制来定位相关片段,以实现更高效的问题解答,在计算成本较低的情况下优于基础模型。CausalMem 提供了一种无需训练的方法来构建动态、固定预算的内存库,在 LLaVA-OneVis…

  6. RESEARCH · CL_50513 ·

    新研究推进AI模型的向量量化技术

    几篇最新的研究论文探讨了AI模型向量量化技术的进展。ArcVQ-VAE引入了球形角度裕度先验,以提高图像建模中的潜在表示多样性和码本利用率。高斯VAE被用于一种无需训练的方法(Gaussian Quant)中,将其转换为VQ-VAE,性能优于现有方法。DiVeQ提供了一种使用重参数化技巧进行向量量化端到端训练的可微分方法,提高了压缩和生成任务的性能。MGVQ通过集成多维敏感度感知和梯度-Hessian融合来实现超低比特量化,专注于压缩…