研究人员开发了一种名为SNAP的新方法,通过生成有效的合成难负例来改进视觉-语言预训练。现有方法在跨模态构建(会产生过于容易的负例)或内模态构建(包含正例)方面存在困难。SNAP通过创建避免任一模态正例的内模态难负例来解决这些问题,当应用于CLIP和FLIP等模型时,能在零样本检索和分类任务中带来持续的改进。 AI
影响 改进零样本检索和分类,可能增强多模态AI应用。
排序理由 关于视觉-语言预训练新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →