实体
visual question answering (VQA)
visual question answering (VQA)
PulseAugur coverage of visual question answering (VQA) — every cluster mentioning visual question answering (VQA) across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
新型后门攻击利用自然语言触发器攻击多模态AI模型
研究人员开发了一种名为文本引导后门(TGB)的新型后门攻击,该攻击针对多模态预训练模型。与先前需要特定触发条件的前向攻击不同,TGB利用自然出现的词语作为触发器,使其更隐蔽且适用于现实场景。通过引入视觉对抗性扰动可以调整攻击的强度,从而在不改变被污染数据的情况下灵活控制其有效性。在组合图像检索和视觉问答等任务上的实验证明了TGB利用这些模型安全漏洞的能力。
-
新基准解决胃肠内窥镜检查AI模型的幻觉问题
研究人员开发了新的基准和数据集,以解决用于胃肠内窥镜检查的视觉语言模型(VLM)中的幻觉问题。一项研究介绍了使用Gut-VLM数据集的基准,对五个VLM的九种幻觉检测方法进行了评估,发现ReXTrust等白盒方法表现明显更好。另一篇论文提出了SAGE数据集,该数据集专门从南亚地区收集,以对抗胃肠内窥镜检查AI中的人口偏见,并评估当前模型在不同数据集上的性能下降情况。