image captioning
PulseAugur coverage of image captioning — every cluster mentioning image captioning across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新的BioPro框架旨在解决视觉语言模型中的性别偏见
研究人员推出了一种名为BioPro的新型框架,旨在解决视觉语言模型(VLMs)中的性别偏见。与以往应用统一去偏的方法不同,BioPro采用差异感知方法,选择性地减少中性语境中的偏见,同时保留明确语境中的有效性别区分。该框架无需训练,利用反事实嵌入和投影来中和与性别相关的信息,在图像字幕生成和文本到图像生成任务中均显示出有效性。BioPro的应用范围超越了性别,它在泛化到连续偏见变量(如场景亮度)方面也取得了成功。
-
新基准解决胃肠内窥镜检查AI模型的幻觉问题
研究人员开发了新的基准和数据集,以解决用于胃肠内窥镜检查的视觉语言模型(VLM)中的幻觉问题。一项研究介绍了使用Gut-VLM数据集的基准,对五个VLM的九种幻觉检测方法进行了评估,发现ReXTrust等白盒方法表现明显更好。另一篇论文提出了SAGE数据集,该数据集专门从南亚地区收集,以对抗胃肠内窥镜检查AI中的人口偏见,并评估当前模型在不同数据集上的性能下降情况。
-
PhaseWin算法增强了AI模型解释的视觉归因能力
研究人员推出了一种名为PhaseWin的新型算法,旨在提高解释视觉和视觉-语言模型的可视归因方法的效率和忠实度。与需要大量模型评估的现有贪婪方法不同,PhaseWin采用分阶段窗口搜索策略。该方法在全局筛选、剪枝和局部精炼之间交替进行,以实现线性评估复杂性,同时保持接近贪婪的忠实度。在图像分类和字幕生成等各种任务上的实验表明,与其它归因技术相比,PhaseWin能够以显著减少的前向传播次数达到高忠实度。
-
新框架模拟多模态大语言模型中的复杂人格
研究人员开发了一个新的框架,用于条件化和评估多模态大语言模型(MLLMs)的人格。他们的实验表明,虽然人格诱导可以增强图像字幕生成,但可能会阻碍视觉问答等精确推理任务的性能。研究还观察到多重特征构成和动态切换过程中的平衡和残余效应,这表明模型行为受到过去和现在人格约束的影响。