LLaVA-1.5-7B
PulseAugur coverage of LLaVA-1.5-7B — every cluster mentioning LLaVA-1.5-7B across labs, papers, and developer communities, ranked by signal.
6 天有情绪数据
-
新框架通过DPO和可解释推理改进多模态灾害评估
研究人员开发了一种新颖的两阶段多模态灾害严重性评估训练框架,该框架整合了监督微调(SFT)和直接偏好优化(DPO)。该方法利用统一的数据构建流程生成两个数据集:用于SFT的ReasoningSet和用于DPO对齐的PreferenceSet。实验表明,在分类准确性和解释质量方面均有显著改进,后续的DPO对齐进一步增强了可解释性。通过在InternVL-3-8B和LLaVA-1.5-7B上的跨模型验证,证明了该框架的鲁棒性,从而能更好地…
-
研究人员针对LLaVA中的物体幻觉问题,定位其注意力头
研究人员开发了一种方法来解决LLaVA-1.5-7B等视觉语言模型中的物体幻觉问题。通过识别并针对那些导致生成图像中不存在的物体的特定注意力头,他们能够显著减少此类幻觉的发生。这种诊断到干预的流程,使用了LoRA适配器和接地控制器等技术,在COCO数据集上显示出幻觉物体提及次数的明显减少,尽管这也略微降低了物体召回率。
-
AI研究聚焦Transformer的高效视觉分词处理
研究人员正在开发新的方法来优化AI模型中视觉分词的使用,特别是对于视觉Transformer和视觉-语言模型。这些方法旨在通过选择性地修剪或压缩不太关键的分词来降低计算成本并提高推理效率。技术包括面向分词的语义通信、基于注意力分数的头部感知修剪以及用于紧凑视频表示的自适应分词选择。目标是在准确性和效率之间取得更好的权衡,使这些模型能够在资源受限的环境中更有效地运行。
-
新的 ClustRS 算法提升了 VLM 的效率和鲁棒性
研究人员开发了 ClustRS,这是一种新颖的、无需训练的两部分算法,旨在提高视觉语言模型(VLM)的效率和鲁棒性。该方法采用注意力加权聚类方法来识别和选择代表性的视觉令牌,然后进行去噪步骤来精炼这些令牌。ClustRS 算法显著减少了所需的视觉令牌数量,使得 LLaVA 等 VLM 更适合在边缘设备上部署,并提高了它们对各种图像噪声条件的抵抗能力。
-
中国科学院发布GMC以实现高效多模态AI
中国科学院自动化研究所智东太初大模型团队的研究人员开发了一种名为“基于证据的共核集剪枝”(Grounded Message Coreset Pruning, GMC)的新颖方法。该技术解决了多模态模型中Token冗余带来的高内存占用和推理速度慢的重大挑战。GMC通过自适应地从语义、视觉和空间角度选择互补证据,然后有效地将信息从不太重要的Token传输到代表性Token,所有这些都不需要额外的训练或外部模型。
-
新的TGIF模块可减少多模态大语言模型的幻觉
研究人员开发了TGIF(文本引导的层间融合),这是一种旨在减少多模态大语言模型(MLLMs)幻觉的新型模块。与以往侧重于文本或静态视觉特征融合的方法不同,TGIF根据输入查询动态地融合来自视觉编码器不同层的视觉特征。这种方法无需更新视觉编码器,并且计算开销极小。当与LLaVA-1.5-7B集成时,TGIF在减少幻觉和提高OCR和VQA任务的性能方面表现出持续的改进,同时在ScienceQA和MMBench等其他基准测试上保持或提高了结果。
-
新的审计方法评估MLLM中的视觉令牌溯源
一篇新的研究论文介绍了一种审计多模态大型语言模型(MLLM)中视觉令牌空间溯源的方法。该方法超越了传统的准确性指标,以评估模型正确答案是否可以追溯到支持它的特定视觉区域。研究表明,虽然准确性可能保持稳定,但不同的剪枝策略会导致可追溯性水平的巨大差异,从而影响模型的可靠性。提出的审计方法还显示出在批处理预填充速度和减少内存使用方面有潜在的收益,尽管有利的验证点不能保证任务通用压缩。
-
使用面部空想性错觉诊断探测视觉模型的偏见
研究人员开发了一个新的诊断框架,利用面部空想性错觉来评估视觉模型在面对模糊视觉输入时的行为。该研究分析了包括视觉-语言模型(VLMs)、纯视觉分类器和目标检测器在内的六个模型,以了解它们的决策过程。研究结果表明,LLaVA-1.5-7B等VLMs倾向于表现出语义过度激活,经常将非人脸图案误解为人脸,特别是带有负面情绪的图案。相比之下,ViT等纯视觉分类器在没有明显偏见的情况下表现出不确定性,而目标检测器则通过保守的先验知识保持低偏见。
-
新框架通过注入证据来对抗医学MLLM的幻觉
研究人员开发了一个新颖的、无需训练的框架,以增强医学多模态大语言模型(MLLM)的可信度。该系统名为协同感知-推理治理(Synergistic Perception-Reasoning Governance),通过在推理过程中注入可验证的解剖学证据来解决幻觉问题。它通过区域感兴趣(ROI)引导的激活调制来重新校准视觉感知,并通过将解剖学坐标映射到语义令牌来锚定文本推理。在多个数据集上使用各种MLLM进行的评估表明,准确性显著提高,幻觉大幅减少。
-
视觉语言模型在课堂参与度识别方面表现不佳
一项新的基准研究评估了五种视觉语言模型(VLMs)在零样本设置下识别课堂参与度的能力。包括GPT-4o和LLaVA-1.5-7B在内的模型在识别单个学生参与度方面表现不佳,呈现出随机表现和类别坍塌。然而,场景级分类显示出更大的潜力,CLIP和GPT-4o在提供特定评分标准提示时达到了中等准确率。研究还强调了实际部署的挑战,例如GPT-4o的安全过滤器拒绝了大量涉及学生面部的请求。
-
新研究增强了用于医疗、检索和机器人任务的视觉-语言模型
研究人员正在开发新方法来改进各种领域的视觉-语言模型(VLM)。一篇论文介绍了CoT-Mediate,一个用于评估生成推理如何影响VLM在医疗情境下预测的框架,发现推理的位置比其声明的来源更关键。另一项研究提出了ReToken,一个可学习的单一嵌入,通过选择相关的视觉标记来增强视觉检索,在Visual Haystacks和LVBench等基准测试中显示出显著的提升。对于机器人领域,BioVLN是一个专为生物医学实验室视觉-语言导航设计…
-
新的剪枝技术有望实现更小的模型和更快的训练速度
研究人员开发了新的神经网络和数据集剪枝方法以提高效率。DCP-Prune 专注于视觉模型的超低 token 剪枝,以显著更少的 token 实现高性能。Squeeze-Release 提供迭代剪枝和结构最小化,模型压缩高达 39 倍,同时保持准确性。此外,OrderDP 和一个基于图的框架提供了理论上保证的无损动态数据剪枝,在不牺牲性能的情况下将训练速度提高了 40% 以上。
-
新方法大幅削减VLM视觉Token,提升效率
研究人员开发了三种新方法,可显著压缩大型视觉语言模型(VLM)使用的视觉Token,旨在降低计算开销并提高推理速度。InfoMerge利用时间指纹差异和内容感知分配,ETC采用任务感知视觉信息蒸馏,EvoCut分析多层Token演化。这些方法在Token数量上实现了大幅削减,其中一些在保持超过98%的原始性能的同时实现了显著的加速。
-
AI 微调用于桥梁损坏评估和维修优先级评分
研究人员开发了一种方法,利用微调的视觉语言模型(VLMs)来自动化桥梁损坏评估和维修优先级评分。通过使用精选的桥梁图像和检查记录数据集训练 LLaVA-1.5-7B,该模型可以生成损坏的自然语言描述。然后,一个基于规则的系统利用这些描述来计算维修优先级指数,旨在减少人工检查员之间的差异并协助老龄化工程师。
-
苹果研究人员用新的RL框架平衡图像字幕生成
苹果研究人员开发了BalCapRL,一个用于基于强化学习的多模态大语言模型图像字幕生成的新框架。该方法旨在平衡字幕质量的多个维度,包括正确性、参考覆盖率和语言流畅性,而这些维度在现有方法中常常被牺牲。BalCapRL利用奖励解耦归一化和长度条件奖励掩码来优化这些目标,在LLaVA和Qwen等各种基础模型上显示出显著的改进。
-
新框架使用基础模型进行车内对象检测
研究人员开发了一种名为ODAL的新型框架,用于检测和定位车内对象,旨在克服车载系统的计算限制。该框架将处理过程分配给车载和云端资源,从而能够使用强大的视觉基础模型。引入了一个新的基准ODALbench来评估性能,经过微调的LLaVA 1.5 7B模型达到了89%的ODAL分数,比GPT-4o高出近20%,并显著减少了幻觉。
-
研究人员分析多模态机器学习遗忘中的指标不可靠性
研究人员发现,当前用于评估视觉语言模型(VLM)机器学习遗忘的指标存在显著的不可靠性。对36个已遗忘的LLaVA-1.5-7B模型的分析显示,遗忘准确率(Forget Accuracy)和保留准确率(Retain Accuracy)等标准指标常常与激活距离(Activation Distance)和JS散度(JS divergence)等其他指标产生冲突。为解决此问题,研究人员开发了一种新的统一质量评分(UQS),该评分通过根据指标与…