PulseAugur
实时 21:59:12
实体 LLaVA-NeXT

LLaVA-NeXT

PulseAugur coverage of LLaVA-NeXT — every cluster mentioning LLaVA-NeXT across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 8
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 8
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 8 条
  1. TOOL · CL_154709 ·

    研究发现视觉令牌修剪会影响多模态大语言模型的校准

    一篇新的研究论文探讨了视觉令牌修剪对多模态大语言模型(MLLMs)校准的影响。该研究发表在arXiv上,揭示了修剪令牌的方法显著影响模型校准,即模型置信度与其正确性之间的一致性。基于覆盖率的修剪方法,侧重于保持证据覆盖率,在LLaVA-1.5和Qwen2-VL等各种模型上,以最小的准确率损失实现了校准的改进。相比之下,基于注意力的修剪方法有时会导致准确率下降和过度自信增加。

  2. TOOL · CL_154583 ·

    CRISP框架通过修剪视觉令牌来提高LVLM效率

    研究人员开发了CRISP,一个新颖的框架,旨在通过在视觉令牌被语言模型处理之前对其进行修剪来提高大型视觉语言模型(LVLM)的效率。这种两阶段方法首先识别与文本对齐的令牌,然后增强上下文的完整性,旨在在显著降低推理成本和延迟的同时保持准确性。在LLaVA-1.5和LLaVA-NeXT模型上的实验表明,CRISP可以在保持高达99.5%的准确性的同时,将推理时间缩短一半以上,为资源受限的环境提供了一个实用的解决方案。

  3. RESEARCH · CL_133255 ·

    Video2Reaction 数据集将视频映射到观众情绪 · 已追踪 2 个来源

    研究人员推出了 Video2Reaction,这是一个新的多模态数据集和基准,旨在预测观众对视频内容的情感反应。该数据集包含超过 10,000 个视频,利用一个两阶段的流程和开源 LLM 来标注社交媒体引发的情绪,准确率达到 86%。虽然微调的基础视频模型显示出潜力,但即使是 LLaVA-NeXT 等最先进的方法在处理固有的主观性时也面临挑战,在预测主要反应方面仅达到 77% 的 Top-3 F1 分数。

  4. RESEARCH · CL_128948 ·

    新研究聚焦大语言模型推理、长上下文和工具集成

    多篇研究论文探讨了大语言模型(LLM)推理能力的进步,重点在于提高长时任务和工具集成的性能。Apple的研究引入了LEAD,一种通过整合未来验证和重叠回滚来克服LLM推理中“无恢复瓶颈”的方法,使模型能够解决跳棋跳跃等复杂问题。其他论文提出了用于工具集成推理中的逐轮回溯自我蒸馏的TurnSight,衡量解释器稳定性的方法,以及通过测试时缩放和从失败轨迹中反思性学习来分析和改进推理过程的技术。此外,研究还探讨了优化推理接口以缩短响应时间…

  5. RESEARCH · CL_111313 ·

    ReasonCLIP-58M通过视觉常识推理增强CLIP模型

    研究人员推出ReasonCLIP-58M,一个用于持续预训练CLIP风格模型的新框架。该方法整合了大规模推理监督,以增强视觉基础的常识推理和组合推理能力。该框架采用两阶段策略,在逐步添加推理信号的同时保持描述性对齐,并得到了新的数据集和诊断评估基准的支持。ReasonCLIP-58M可用作多模态大型语言模型的即插即用视觉编码器,在不增加推理成本的情况下提高性能。

  6. RESEARCH · CL_110189 ·

    新的TOPS方法剪枝视觉令牌以实现高效的MLLM推理

    研究人员开发了TOPS,一种用于剪枝多模态大语言模型(MLLM)中视觉令牌以提高效率的新颖方法。与依赖注意力分数或令牌相似性的先前方法不同,TOPS使用基于第一性原理的信息论框架,根据任务相关性、信息覆盖率和语义多样性来识别关键令牌。这个无需训练且模型无关的模块已经在各种MLLM中展示了显著的性能提升,特别是在LLaVA-NeXT上将视觉令牌减少了77%以上,同时保持甚至略微提高了性能。

  7. RESEARCH · CL_91013 ·

    新的ALVTS方法通过自适应令牌选择提升LVLM效率

    研究人员推出了一种名为自适应层级视觉令牌选择(ALVTS)的新框架,旨在提高大型视觉语言模型(LVLM)的效率。与先前永久丢弃令牌的方法不同,ALVTS动态选择重要令牌进行进一步处理,同时允许不太关键的令牌跳过某些层。这种自适应方法在无需重新训练模型的情况下最大限度地减少了计算冗余。实验表明,ALVTS可以在LLaVA-1.5、LLaVA-NeXT和Qwen2.5-VL等基准测试中实现89%的令牌压缩率,同时保留原始模型96.7%的准确性。

  8. RESEARCH · CL_51388 ·

    新的AI研究聚焦于通过量化和Token剪枝提升模型效率

    研究人员正在开发新的方法,通过量化和Token剪枝来提高AI模型的效率。一种名为PeRQ的方法,通过在旋转前重新分配激活质量来增强训练后量化,从而显著提高了Llama3 1B等模型的准确性。另一种方法OccamToken,通过使用寄存器锚定的相对证据测试,有效地剪枝视觉语言模型(VLM)中的视觉Token,在保持准确性的同时减少了Token数量。此外,Clark Hash提供了一种无状态编解码器,用于紧凑的神经嵌入存储,以最小的准确性…