PulseAugur
中
实时 10:19:53
实体 LLaVA-onevision

LLaVA-onevision

PulseAugur coverage of LLaVA-onevision — every cluster mentioning LLaVA-onevision across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
9
90 天内 9
发布 · 30天
0
90 天内 0
论文 · 30天
9
90 天内 9
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 9 条
  1. RESEARCH · CL_227219 ·

    新的基准和方法解决了跨模态和跨领域的 LLM 幻觉问题

    研究人员正在开发新的方法和基准,以检测和减轻各种模态和领域的 LLM(大语言模型)中的幻觉。OmniHallu 为检测多模态理解和生成任务中的幻觉提供了一个统一的框架,并得到了新基准的支持。另一种方法侧重于特定领域的幻觉检测,结合分类、不确定性量化和偏好优化,以减少 Qwen2.5 等模型中的错误。对于法律应用,LexAgentHallu 被引入为一个基准,用于分析工具增强型法律代理中的幻觉,并突出代理的失败。此外,证据对齐实体验证 …

  2. RESEARCH · CL_227216 ·

    新研究优化长视频多模态大语言模型的视觉标记处理

    研究人员正在探索优化多模态大语言模型(MLLMs)处理视觉信息的方法,尤其是在处理长视频方面。多篇论文介绍了用于选择、压缩和修剪视觉标记以提高效率和准确性的技术。一项研究强调,帧选择是最关键的因素,经典的算法如正交匹配追踪(Orthogonal Matching Pursuit)与新方法相比表现相当。其他方法则侧重于自适应标记化、基于注意力熵的秩保持修剪以及为持续学习动态生成标记。

  3. TOOL · CL_212130 ·

    新的 ClustRS 算法提升了 VLM 的效率和鲁棒性

    研究人员开发了 ClustRS,这是一种新颖的、无需训练的两部分算法,旨在提高视觉语言模型(VLM)的效率和鲁棒性。该方法采用注意力加权聚类方法来识别和选择代表性的视觉令牌,然后进行去噪步骤来精炼这些令牌。ClustRS 算法显著减少了所需的视觉令牌数量,使得 LLaVA 等 VLM 更适合在边缘设备上部署,并提高了它们对各种图像噪声条件的抵抗能力。

  4. RESEARCH · CL_139317 ·

    GeoTrace框架压缩视频令牌,以提高视频大语言模型的效率

    研究人员推出GeoTrace,一个新颖的框架,旨在通过压缩视频令牌来提高视频大语言模型(Video LLMs)的效率。这种无需训练的方法使用上下文最远点锚定和轨迹约束残差凝结,将视频证据分解为骨架和残差事件令牌。GeoTrace已在各种Video LLMs和基准测试中证明了其有效性,在保持高性能的同时显著降低了计算负载。

  5. RESEARCH · CL_128851 ·

    新方法逐个标记追踪多模态大语言模型注意力

    研究人员开发了一种名为“逐个标记”(OTaT)的新方法,用于分析多模态大语言模型(MLLMs)在响应生成过程中如何利用视觉和文本信息。该技术追踪对图像、文本、指令和先前生成标记的注意力转移,揭示了各种MLLMs之间的一致模式。研究发现,当需要图像派生信息时,对图像的注意力达到峰值;在任务转换期间会重新审视指令;随着时间的推移,对生成标记的注意力会增加。基于这些发现的干预措施显著提高了多模态任务的性能。

  6. TOOL · CL_121209 ·

    新框架提升大语言模型高分辨率图像感知能力

    研究人员推出了一种名为分层实体探索(HEE)的新型框架,旨在增强多模态大语言模型(MLLMs)的高分辨率图像感知能力。与需要大量训练或依赖固定图像分割的现有方法不同,HEE无需训练且模型无关。它通过首先评估区域是否有足够证据,然后使用对象检测进行细粒度细节分析,并将这些信息组织成语义层次结构,来动态指导实体探索。该方法旨在通过置信度引导的回溯实现自适应感知,从而克服当前高分辨率图像处理中常见的细节丢失问题。

  7. RESEARCH · CL_117463 ·

    新框架通过保留知识和改进生成来增强多模态AI

    研究人员正在开发新框架以增强多模态AI模型。Rosetta 引入了一种可组合的预训练方法,可以在不破坏现有知识的情况下添加新模态并保留核心知识,使用动量锚定正交投影来管理梯度冲突。COMPASS 在统一系统中将组合意图控制进行接地,通过使用共享的专家令牌来同时改进感知和生成。SRUM 使统一的多模态模型能够通过使用其理解模块作为内部评估器来改进其生成能力,采用双重奖励系统来保证全局和局部保真度。此外,ReVisIT 提供了一种无需训练…

  8. RESEARCH · CL_107765 ·

    新方法通过高效内存和重看能力增强流媒体视频理解 · 跟踪 6 个来源

    研究人员开发了新方法,在严格的计算和内存限制下提高流媒体视频理解 (SVU) 能力。ProtoKV 是一种新颖的内存系统,将旧视频内容聚合为摘要状态,在延迟查询场景下准确率提高高达 12.5 个百分点。另外,video-SALMONN-R$^3$ 使用重看机制来定位相关片段,以实现更高效的问题解答,在计算成本较低的情况下优于基础模型。CausalMem 提供了一种无需训练的方法来构建动态、固定预算的内存库,在 LLaVA-OneVis…

  9. RESEARCH · CL_50513 ·

    新研究推进AI模型的向量量化技术

    几篇最新的研究论文探讨了AI模型向量量化技术的进展。ArcVQ-VAE引入了球形角度裕度先验,以提高图像建模中的潜在表示多样性和码本利用率。高斯VAE被用于一种无需训练的方法(Gaussian Quant)中,将其转换为VQ-VAE,性能优于现有方法。DiVeQ提供了一种使用重参数化技巧进行向量量化端到端训练的可微分方法,提高了压缩和生成任务的性能。MGVQ通过集成多维敏感度感知和梯度-Hessian融合来实现超低比特量化,专注于压缩…