BLIP-2
PulseAugur coverage of BLIP-2 — every cluster mentioning BLIP-2 across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新型大语言模型生成可解释的自动驾驶行为描述
研究人员开发了CommandLM,这是一种新颖的多模态大语言模型,旨在从融合的传感器数据生成人类可读的自动驾驶车辆行为描述。该模型通过Q-Former适配器和量化、LoRA微调的大语言模型集成了LiDAR和多摄像头输入。它在CommandLM-nuScenes数据集上进行训练,旨在通过提供可解释的、意图感知的字幕来增强自动驾驶系统的安全性、信任度和法规遵从性。
-
HorusEye框架将语言作为动态注意力用于紧急情况视觉分析
一篇新研究论文介绍了HorusEye,一个专为紧急情况视觉分析设计的框架,它将语言视为动态注意力。该研究在模拟雾、烟和热成像等条件的退化数据集上对Gemini、Qwen2-VL、BLIP-2、LLaVA和Kosmos-2等多种视觉语言模型(VLMs)进行了基准测试。主要发现表明,语言反馈在不同VLMs上对模型性能有显著不同的影响,Gemini在热成像条件下表现出显著改进,而Qwen2-VL则性能下降。研究还强调了一个“热成像悖论”,即…
-
研究发现,医学VLM基准存在预训练污染
研究人员审计了公共医学视觉-语言基准中是否存在预训练污染,发现在SLAKE-En基准上,SigLIP-B-16等模型存在可衡量的图像侧重叠。文本分析显示,Qwen2.5-VL在SLAKE-En上以及其他VLMs在OmniMedVQA上存在规范顺序可交换信号。然而,研究得出结论,某些检测方法(如队列相对尾部富集)对于小型医学VLM队列并不可靠。
-
RadJEPA:无需语言的胸部X光片自监督分析模型
研究人员开发了RadJEPA,一种新颖的医学影像分析自监督学习框架,专门用于胸部X光片。与依赖配对图像-文本数据的先前方法不同,RadJEPA通过从可见上下文中预测掩蔽区域来学习大约84万张未标记的X光片图像。这种方法旨在克服临床叙述偏差和数据可用性的限制。评估表明,在放射报告生成、疾病分类和语义分割任务中,RadJEPA的性能与现有的仅图像和视觉-语言基线相当或更优。
-
新框架改进医学图像分割和诊断
研究人员开发了Rad-VLSM,一个旨在增强医学图像分割和诊断的新型两阶段框架。该系统使用视觉语言模型来识别潜在病灶区域,并将它们转换为边界框提示。这些提示随后指导分割网络,通过关注病灶级别的证据而不是仅仅依赖文本到诊断的关联来提高准确性。该框架整合了视觉特征和放射组学数据,以获得更稳健的诊断结果。
-
新研究表明,视觉语言模型的通用对抗性攻击效果不如预期
研究人员开发了一种新的评估方法VisInject,用于区分视觉语言模型对抗性攻击中的一般性扰乱和精确注入。他们的研究结果表明,虽然许多攻击可以扰乱模型输出,但精确注入特定概念的成功率远低于此前的报道。该研究利用DeepSeek-V4-Pro和Claude Opus 4.7进行评估,并发布了一个包含对抗性图像和模型响应的数据集,以促进进一步的研究。