研究人员推出了一种名为ITO的新框架,旨在通过增强多模态数据的对齐和融合来改进图像-文本预训练。ITO利用多视图图像增强技术创建多样化的跨模态对应关系,从而丰富监督信息。此外,在训练过程中采用了一个轻量级融合模块来正则化编码器,促进特征兼容性,同时不影响推理效率。在从数百万到数十亿图像-文本对的各种规模的实验表明,ITO在分类、检索和多模态基准测试中均优于强大的对比基线,并持续超越CLIP。 AI
影响 这项研究可能带来更具语义组织的视觉表示,从而提高多模态任务的性能。
排序理由 该集群描述了一篇关于图像-文本预训练新颖框架的最新研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →