研究人员开发了MAG,一个新颖的框架,旨在通过有效利用无标签数据来增强多模态大语言模型(MLLMs)的上下文学习能力。MAG将演示选择视为多模态图上的半监督问题,解决了显著影响MLLM性能的高质量演示选择的挑战。该框架采用两阶段过程:首先,它通过无标签数据传播相关性分数,以识别有影响力的样本进行伪标签化,从而降低计算成本。其次,它利用多模态相关性,结合视觉和文本信息,来最终确定演示选择。在八个多模态基准上的实验表明,MAG在低标签场景下始终优于现有方法,并在受限的伪标签预算下取得了显著的改进。 AI
影响 增强了多模态LLM在低数据场景下的适应性,有可能提高各种跨模态任务的性能。
排序理由 该集群包含一篇详细介绍多模态上下文学习新框架的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- eight multi-modal benchmarks
- Hugging Face
- MAnifold Guided Semi-Supervised Multi-modal In-Context Learning
- MLLMs
- Multi-modal graph regularization based class center discriminant analysis for cross modal retrieval
- Multi-modal Large Language Models
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →