PulseAugur
中
实时 18:43:26
实体 LLaVA-NeXT-7B

LLaVA-NeXT-7B

PulseAugur coverage of LLaVA-NeXT-7B — every cluster mentioning LLaVA-NeXT-7B across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
7
90 天内 7
发布 · 30天
0
90 天内 0
论文 · 30天
6
90 天内 6
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 7 条
  1. RESEARCH · CL_254384 ·

    新方法通过优化标记处理加速视觉语言模型推理 · 已追踪2个来源

    两篇新的研究论文提出了通过减少计算开销来加速视觉语言模型(VLMs)推理的方法。StackTok 专注于自适应视觉标记选择,在保持预算校准的视觉覆盖范围的同时,优先考虑查询相关性。另一方面,AdaVSkip 通过使用轻量级路由器,根据输入特异性动态地跨 Transformer 层跳过视觉标记,来解决垂直冗余问题。这两种方法都旨在在无需重新训练模型的情况下显著降低计算成本,其中 AdaVSkip 在保持 LLaVA-NeXT-7B 等模…

  2. TOOL · CL_235551 ·

    新数据集和框架应对对话中的多模态大模型安全问题

    研究人员推出 MINT-Safe,这是一个旨在解决多模态大语言模型(MLLMs)在扩展对话交互中安全问题的新数据集。该数据集包含 11,270 个多图像对话和 500 对拒绝式视觉问答(VQA)对,是通过多代理交互和文本到图像增强创建的。为了利用 MINT-Safe,该团队还开发了 TAD-Align 框架,该框架使用面向轮次的双目标奖励函数来动态识别和上调表现出不一致安全行为的对话轮次。在 Qwen2.5-VL-7B-Instruc…

  3. TOOL · CL_206622 ·

    新基准揭示视觉语言模型安全推理差距

    名为SafeGesture的新基准已被开发出来,用于评估视觉语言模型(VLM)在安全关键场景下的细粒度手势理解能力。该基准将六种手势与八种操作环境配对,共产生4,800个评估项。对GPT-4o和Qwen2.5-VL-7B等模型的初步测试显示,手势识别准确率与安全行为推断之间存在显著差距,表明推理安全情景是当前VLM面临的主要挑战。

  4. RESEARCH · CL_191100 ·

    新的方法出现,用于AI模型中高效的视觉Token修剪 · 跟踪6个来源

    研究人员正在开发新的方法来优化视觉Transformer (ViTs) 和多模态大语言模型 (MLLMs),通过修剪计算成本高昂的视觉Token。几篇论文提出了新颖的技术,以在不显著降低性能的情况下减少处理的Token数量。这些方法包括递归ViTs的训练后Token合并、使用专用寄存器的任务自适应修剪、预测中间层注意力以确定Token重要性、面向角色的区域分配以及用于设计修剪策略的AI驱动框架。

  5. TOOL · CL_185474 ·

    RUTA方法在保持性能的同时大幅减少了LLM的视觉标记

    研究人员开发了RUTA,一种用于减少大型语言模型处理的视觉标记数量的新颖方法。RUTA学习根据查询特定相关性和速率-效用目标来选择和分配标记,平衡任务性能与计算成本。在评估中,RUTA在LLaVA-NeXT-7B和Qwen3-VL-8B等模型上显著减少了标记使用量,同时保留了高比例的任务性能。

  6. RESEARCH · CL_133151 ·

    AnchorPrune 框架通过剪枝 token 来提高视觉语言模型的效率

    研究人员开发了 AnchorPrune,一个新颖的框架,旨在通过剪枝冗余视觉 token 来优化大型视觉语言模型的效率。这种无需训练的方法构建了一个相关性锚点,并用互补的上下文进行扩展,保留了关键的查询信息,同时恢复了信息丰富、非冗余的细节。AnchorPrune 在准确性-效率权衡方面表现出显著的改进,尤其是在积极压缩下,以一小部分原始 token 保持了高性能。

  7. RESEARCH · CL_14346 ·

    感知流网络和VGR增强LLM的视觉推理能力

    研究人员开发了感知流网络(PFlowNet)以提高大型视觉语言模型(LVLMs)的视觉推理能力。PFlowNet将感知与推理分离,并使用变分强化学习来指导感知行为,旨在减少语言偏见和幻觉。该方法在V* Bench和MME-RealWorld-lite等基准测试中取得了最先进的成果。另一个相关模型VGR通过将语言推断基础化到检测到的图像区域中来增强多模态推理能力,在ChartQA等基准测试中显示出显著的改进,同时使用的图像令牌更少。