PulseAugur
实时 18:29:20
实体 LLaVA-1.5

LLaVA-1.5

PulseAugur coverage of LLaVA-1.5 — every cluster mentioning LLaVA-1.5 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 11
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 10
层级分布 · 90 天
主题
关系
情绪 · 30 天

3 天有情绪数据

最近 · 第 1/1 页 · 共 11 条
  1. RESEARCH · CL_215992 ·

    新的基准测试探究视觉语言模型空间推理能力,揭示其在目标定位和关系理解方面的不足 · 追踪 5 个来源

    研究人员正在开发新的基准测试和方法论,以更好地理解和诊断视觉语言模型(VLMs)在空间推理方面的失败。一种名为 GUI-Primitives 的方法使用对比指令对来隔离在理解图形用户界面内部空间关系方面的失败,揭示出当前的 VLM 在目标定位和特定关系类型(如包含和遮挡)方面存在困难。另一项研究调查了 LLaVA-1.5 和 Qwen2.5-VL 等 VLM 的内部机制,发现精确的目标定位并非总是进行空间推理所必需的,推理遵循一个从基…

  2. TOOL · CL_193875 ·

    新的维纳滤波技术可减少视觉语言模型中的幻觉

    研究人员开发了一种名为维纳表示滤波(Wiener Representation Filtering)的新颖技术,以减少视觉语言模型(VLMs)中的幻觉。这种无需训练的方法在事后通过编辑语言主干的表示空间来运行。通过将隐藏状态建模为真实和幻觉成分的组合,该技术推导出一个维纳型估计器,可以减弱与幻觉相关的模式。该方法应用于 LLaVA-1.5、MiniGPT-4、Gemma3 和 mPLUG-Owl2 等模型,在 CHAIR、POPE 和…

  3. RESEARCH · CL_191100 ·

    新的方法出现,用于AI模型中高效的视觉Token修剪 · 跟踪6个来源

    研究人员正在开发新的方法来优化视觉Transformer (ViTs) 和多模态大语言模型 (MLLMs),通过修剪计算成本高昂的视觉Token。几篇论文提出了新颖的技术,以在不显著降低性能的情况下减少处理的Token数量。这些方法包括递归ViTs的训练后Token合并、使用专用寄存器的任务自适应修剪、预测中间层注意力以确定Token重要性、面向角色的区域分配以及用于设计修剪策略的AI驱动框架。

  4. TOOL · CL_167735 ·

    新的 MoP 框架压缩 LLM,提高效率和准确性

    研究人员开发了一个名为剪枝器混合(Mixture of Pruners, MoP)的新迭代框架,旨在通过减少参数数量和加速推理来压缩大型语言模型(LLM)。MoP 统一了深度和宽度剪枝,在每次迭代中选择最佳候选者来推进压缩路径。该方法在 LLaMA-2 和 LLaMA-3 模型上展示了优于现有结构化剪枝技术的准确性,在 40% 的压缩率下实现了 39% 的端到端延迟降低。该框架还成功应用于视觉语言模型 LLaVA-1.5,提高了其计算效率。

  5. TOOL · CL_154709 ·

    研究发现视觉令牌修剪会影响多模态大语言模型的校准

    一篇新的研究论文探讨了视觉令牌修剪对多模态大语言模型(MLLMs)校准的影响。该研究发表在arXiv上,揭示了修剪令牌的方法显著影响模型校准,即模型置信度与其正确性之间的一致性。基于覆盖率的修剪方法,侧重于保持证据覆盖率,在LLaVA-1.5和Qwen2-VL等各种模型上,以最小的准确率损失实现了校准的改进。相比之下,基于注意力的修剪方法有时会导致准确率下降和过度自信增加。

  6. TOOL · CL_154583 ·

    CRISP框架通过修剪视觉令牌来提高LVLM效率

    研究人员开发了CRISP,一个新颖的框架,旨在通过在视觉令牌被语言模型处理之前对其进行修剪来提高大型视觉语言模型(LVLM)的效率。这种两阶段方法首先识别与文本对齐的令牌,然后增强上下文的完整性,旨在在显著降低推理成本和延迟的同时保持准确性。在LLaVA-1.5和LLaVA-NeXT模型上的实验表明,CRISP可以在保持高达99.5%的准确性的同时,将推理时间缩短一半以上,为资源受限的环境提供了一个实用的解决方案。

  7. RESEARCH · CL_139052 ·

    密歇根大学发布 NeuroVFM 用于神经影像分析

    密歇根大学的研究人员开发了 NeuroVFM,一个新颖的神经影像基础模型。该模型使用 Vol-JEPA 方法,在超过 5.24 百万份临床 MRI 和 CT 扫描上进行训练,NeuroVFM 从未经整理的医学数据中学习,无需放射报告标签。这种自监督方法在众多诊断任务中取得了高性能,并展示了在医学影像分析中生成报告、患者分诊和跨模态迁移等应用的潜力。

  8. TOOL · CL_109968 ·

    新框架应对多模态大语言模型中的灾难性遗忘问题

    研究人员推出了一种名为 Curvature-Guided Mixing (CGM) 的新框架,旨在改进多模态大语言模型 (MLLM) 的适应性。该方法解决了灾难性遗忘问题,即在特定任务上进行微调会损害通用能力。CGM 利用损失景观的二阶近似,根据预训练模型和微调模型各自损失景观的曲率,分析性地确定混合它们的最佳比例。增强版 CGM$ exttt{ ext{ extdagger}}$ 通过一种新颖的曲率感知评分来指导鲁棒的参数选择。在 …

  9. RESEARCH · CL_91013 ·

    新的ALVTS方法通过自适应令牌选择提升LVLM效率

    研究人员推出了一种名为自适应层级视觉令牌选择(ALVTS)的新框架,旨在提高大型视觉语言模型(LVLM)的效率。与先前永久丢弃令牌的方法不同,ALVTS动态选择重要令牌进行进一步处理,同时允许不太关键的令牌跳过某些层。这种自适应方法在无需重新训练模型的情况下最大限度地减少了计算冗余。实验表明,ALVTS可以在LLaVA-1.5、LLaVA-NeXT和Qwen2.5-VL等基准测试中实现89%的令牌压缩率,同时保留原始模型96.7%的准确性。

  10. RESEARCH · CL_82221 ·

    视觉语言模型将海岸线预测为折线

    研究人员开发了CoastlineVLM-7B,一个视觉语言模型,旨在直接将海岸线预测为折线而不是分割掩码。这种方法基于GeoChat-7B/LLaVA-1.5架构,专注于使用植被线或沙丘脚等地貌代理进行几何边界定位。在新西兰海岸变化数据集上的评估显示,与传统的分割方法相比,几何对齐得到改善,降低了Hausdorff距离和Earth Mover's距离。

  11. RESEARCH · CL_02088 ·

    VG-CoT: 通过基于实证的思维链实现可信赖的视觉推理

    研究人员推出了VG-CoT,这是一个旨在提高大型视觉语言模型(LVLM)可信度的新数据集。该数据集可自动将推理步骤与图像中的特定视觉证据联系起来,克服了现有需要大量手动标注的数据集的局限性。VG-CoT还包括一个基准,用于评估LVLM在推理质量、答案准确性和推理-答案一致性方面的表现,初步实验显示LLaVA-1.5和Qwen2-VL等模型有所改进。