实体
vision-language modeling
vision-language modeling
PulseAugur coverage of vision-language modeling — every cluster mentioning vision-language modeling across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
OpticalRec 通过统一的视觉-语言编码推动多模态推荐
研究人员推出 OpticalRec,这是一种多模态推荐系统的新方法,它统一了光学和语言表示。与先前分别编码然后组合模态的方法不同,OpticalRec 将文本作为视觉符号集成到视觉编码器中,从而在感知层面实现直接的图像-文本交互。这种统一的编码范式,通过双注意力机制和互信息分析支持,旨在提高协作过滤任务中的项目表示和用户-项目匹配准确性。
-
FairForensics 模型增强了深度伪造检测的公平性和泛化能力
研究人员开发了 FairForensics,这是一种新颖的视觉语言模型,旨在提高深度伪造检测的公平性和泛化能力。该模型通过在一个新构建的、人口统计学上平衡的基准上进行训练,解决了现有检测器中人口统计学偏差的问题。FairForensics 包含一个用于捕捉伪造模式的表情编码器和一个用于减轻偏差的身份感知模块,以及一个用于人口感知特征提取的人口统计学引导语言编码器。实验表明,FairForensics 在深度伪造检测任务的泛化和公平性方…