PulseAugur
实时 10:39:53
实体 BLIP-2

BLIP-2

PulseAugur coverage of BLIP-2 — every cluster mentioning BLIP-2 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 10
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 10
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 10 条
  1. TOOL · CL_244799 ·

    新的JPPO攻击通过优化像素和提示来利用视觉语言模型

    研究人员开发了一种名为联合像素-提示优化(JPPO)的新型对抗性框架,该框架以视觉语言模型(VLMs)为目标。与以往专注于图像扰动的方法不同,JPPO联合优化图像像素和用户可见的提示,以放大资源耗尽攻击。这种方法显著增加了Qwen2.5-VL-7B和BLIP-2等模型的延迟和能耗,揭示了当前VLM服务防御中潜在的安全漏洞。

  2. TOOL · CL_228778 ·

    新的 Siamese 网络方法衡量 AI 艺术与原创作品之间的相似度

    研究人员开发了一种使用 Siamese 神经网络量化原创艺术品与 AI 生成图像之间相似度的方法,特别关注 Stable Diffusion XL Refiner 1.0。该研究构建了一个配对图像数据集,并使用了冻结的 CLIP 编码器,通过三元组损失优化余弦相似度。结果表明,区分原创艺术和生成艺术的准确率很高,最佳模型达到了 99.4% 的测试准确率和强大的类间分离度,表明了有效的语义视觉嵌入。

  3. TOOL · CL_193984 ·

    新的LHSDet方法使用VQA检测高分辨率AI生成图像

    研究人员开发了LHSDet,一种检测高分辨率AI生成图像的新方法。该方法将检测任务重新构建为视觉问答问题,利用了视觉-语言框架。LHSDet采用独特的三分支架构,结合了图像块的低级视觉特征、高级全局感知特征以及文本标题的语义特征,以有效识别来自各种模型(包括扩散和自回归类型)的AI生成图像中的伪影。

  4. TOOL · CL_183152 ·

    新框架学习隐式音乐风格以进行符号生成

    研究人员开发了一个新颖的跨模态框架,用于学习和应用隐式音乐风格来进行符号音乐生成。该模型受BLIP-2启发,利用查询Transformer(Q-Former)从音频语言模型中提取风格表示,然后对符号语言模型进行钢琴编曲的条件设置。通过联合基于乐谱(内容)和参考音频示例(风格)进行条件设置,该方法能够实现可控且风格忠实的生成。实验表明,在钢琴翻唱生成、风格迁移和音频到MIDI检索等任务中,风格感知对齐和音乐质量均有显著提升。

  5. TOOL · CL_165195 ·

    新型大语言模型生成可解释的自动驾驶行为描述

    研究人员开发了CommandLM,这是一种新颖的多模态大语言模型,旨在从融合的传感器数据生成人类可读的自动驾驶车辆行为描述。该模型通过Q-Former适配器和量化、LoRA微调的大语言模型集成了LiDAR和多摄像头输入。它在CommandLM-nuScenes数据集上进行训练,旨在通过提供可解释的、意图感知的字幕来增强自动驾驶系统的安全性、信任度和法规遵从性。

  6. TOOL · CL_93710 ·

    HorusEye框架将语言作为动态注意力用于紧急情况视觉分析

    一篇新研究论文介绍了HorusEye,一个专为紧急情况视觉分析设计的框架,它将语言视为动态注意力。该研究在模拟雾、烟和热成像等条件的退化数据集上对Gemini、Qwen2-VL、BLIP-2、LLaVA和Kosmos-2等多种视觉语言模型(VLMs)进行了基准测试。主要发现表明,语言反馈在不同VLMs上对模型性能有显著不同的影响,Gemini在热成像条件下表现出显著改进,而Qwen2-VL则性能下降。研究还强调了一个“热成像悖论”,即…

  7. TOOL · CL_82555 ·

    研究发现,医学VLM基准存在预训练污染

    研究人员审计了公共医学视觉-语言基准中是否存在预训练污染,发现在SLAKE-En基准上,SigLIP-B-16等模型存在可衡量的图像侧重叠。文本分析显示,Qwen2.5-VL在SLAKE-En上以及其他VLMs在OmniMedVQA上存在规范顺序可交换信号。然而,研究得出结论,某些检测方法(如队列相对尾部富集)对于小型医学VLM队列并不可靠。

  8. TOOL · CL_53988 ·

    RadJEPA:无需语言的胸部X光片自监督分析模型

    研究人员开发了RadJEPA,一种新颖的医学影像分析自监督学习框架,专门用于胸部X光片。与依赖配对图像-文本数据的先前方法不同,RadJEPA通过从可见上下文中预测掩蔽区域来学习大约84万张未标记的X光片图像。这种方法旨在克服临床叙述偏差和数据可用性的限制。评估表明,在放射报告生成、疾病分类和语义分割任务中,RadJEPA的性能与现有的仅图像和视觉-语言基线相当或更优。

  9. TOOL · CL_37955 ·

    新框架改进医学图像分割和诊断

    研究人员开发了Rad-VLSM,一个旨在增强医学图像分割和诊断的新型两阶段框架。该系统使用视觉语言模型来识别潜在病灶区域,并将它们转换为边界框提示。这些提示随后指导分割网络,通过关注病灶级别的证据而不是仅仅依赖文本到诊断的关联来提高准确性。该框架整合了视觉特征和放射组学数据,以获得更稳健的诊断结果。

  10. TOOL · CL_18607 ·

    新研究表明,视觉语言模型的通用对抗性攻击效果不如预期

    研究人员开发了一种新的评估方法VisInject,用于区分视觉语言模型对抗性攻击中的一般性扰乱和精确注入。他们的研究结果表明,虽然许多攻击可以扰乱模型输出,但精确注入特定概念的成功率远低于此前的报道。该研究利用DeepSeek-V4-Pro和Claude Opus 4.7进行评估,并发布了一个包含对抗性图像和模型响应的数据集,以促进进一步的研究。