研究人员引入了一个名为视觉依赖感知(VDA)的新框架,以应对大型语言模型(LLM)的多模态无监督持续后训练(MU-CPT)所面临的挑战。该框架旨在使LLM能够从流式无标签数据中持续学习,而不会灾难性地遗忘之前的任务。VDA利用视觉依赖(VD)的概念,这对于理解跨模态灾难性遗忘和指导新任务学习至关重要。该框架包含两个关键组件:视觉约束最优传输(VC-OT),通过将VD结构失真表述为最优传输问题来缓解遗忘;以及视觉调制适应(VMA),通过利用VD异质性来增强对视觉基础新任务的学习。 AI
影响 该框架可能使LLM能够在不丢失先前获得的知识的情况下适应新的数据流,从而提高其长期效用。
排序理由 该集群包含一篇研究论文,详细介绍了多模态大语言模型持续训练的新框架。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- MLLMs
- ScienceCast
- Visual Dependence-Aware (VDA)
- Visually Constrained Optimal Transport (VC-OT)
- Visually Modulated Adaptation (VMA)
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →