PulseAugur
实时 11:49:09

新的MAG框架利用无标签数据提升多模态LLM的上下文学习能力

研究人员开发了MAG,一个新颖的框架,旨在通过有效利用无标签数据来增强多模态大语言模型(MLLMs)的上下文学习能力。MAG将演示选择视为多模态图上的半监督问题,解决了显著影响MLLM性能的高质量演示选择的挑战。该框架采用两阶段过程:首先,它通过无标签数据传播相关性分数,以识别有影响力的样本进行伪标签化,从而降低计算成本。其次,它利用多模态相关性,结合视觉和文本信息,来最终确定演示选择。在八个多模态基准上的实验表明,MAG在低标签场景下始终优于现有方法,并在受限的伪标签预算下取得了显著的改进。 AI

影响 增强了多模态LLM在低数据场景下的适应性,有可能提高各种跨模态任务的性能。

排序理由 该集群包含一篇详细介绍多模态上下文学习新框架的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.LG 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的MAG框架利用无标签数据提升多模态LLM的上下文学习能力

报道来源 [1]

  1. arXiv cs.LG TIER_1 English(EN) · Zirui Cheng, Xun Xu, Tiankai Chen, Fady Rezk, Bowen Zheng, Xiaodong Shi, Shijie Li, Kangkang Lu, Bharadwaj Veeravalli, Nancy F. Chen ·

    MAG: MAnifold Guided Semi-Supervised Multi-modal In-Context Learning

    arXiv:2608.12724v1 Announce Type: new Abstract: Few-shot in-context learning (ICL) with multi-modal large language models (MLLMs) enables task adaptation without parameter updates, but its performance is highly sensitive to the quality and coverage of the selected demonstrations.…