研究人员推出了两个新框架,以改进大语言模型的多模态指令调优。SAME框架通过稳定专家选择和规范专家更新来解决持续学习中的“路由器漂移”和“专家漂移”问题。同时,OFA框架提供了一种可重用的数据选择方法,只需训练一次选择器即可将其应用于各种数据集和模型,通过仅选择一小部分数据即可显著提高训练效率,同时保持高性能。此外,Prism基础设施提供了一个插件系统,以简化多模态持续指令调优的研发,将算法开发与基础模型实现分离,以增强代码重用和公平比较。
AI
arXiv:2602.01990v2 Announce Type: replace-cross Abstract: Multimodal Large Language Models (MLLMs) achieve strong performance through instruction tuning, but real-world deployment requires them to continually expand their capabilities, making Multimodal Continual Instruction Tuni…
Multimodal instruction tuning is the de facto recipe for adapting vision language models (VLMs), yet instruction data are highly redundant, making data selection critical for training efficiency. Existing methods derive selection signals from a specific model or dataset, so whene…
arXiv:2605.26110v1 Announce Type: cross Abstract: Multimodal Large Language Models (MLLMs) achieve versatility by reformulating diverse tasks into a unified instruction-following framework via instruction tuning. However, real-world deployment requires continuous adaptation to em…
Multimodal Large Language Models (MLLMs) achieve versatility by reformulating diverse tasks into a unified instruction-following framework via instruction tuning. However, real-world deployment requires continuous adaptation to emerging tasks, motivating Multimodal Continual Inst…
arXiv cs.CV
TIER_1English(EN)·Mingkang Dong, Hongyi Cai, Xiwen Lei, Jie Li, Tao Zhang, Muxin Pu·
arXiv:2605.26761v1 Announce Type: new Abstract: Multimodal instruction tuning is the de facto recipe for adapting vision language models (VLMs), yet instruction data are highly redundant, making data selection critical for training efficiency. Existing methods derive selection si…
Multimodal instruction tuning is the de facto recipe for adapting vision language models (VLMs), yet instruction data are highly redundant, making data selection critical for training efficiency. Existing methods derive selection signals from a specific model or dataset, so whene…