研究人员开发了一个名为“能力驱动的多模态缩放定律”的新框架,用于在训练前预测视觉-语言模型(VLMs)的性能。该定律使用从 LLM 文本基准测试中提取的低维能力分数来模拟 VLM 准确性,并考虑每个骨干模型的特定转移和吸收率。对 34 个 LLM 训练的 150 多个 VLM 进行的实验表明,该框架可以准确地将性能从较小模型外推到较大模型,并预测整个训练轨迹。研究还发现,某些文本基准测试可能与多模态性能呈负相关,这表明存在基准测试博弈,并且基础 LLM 通常比指令调整模型更好的 VLM 骨干。 AI
影响 为选择 VLMs 的 LLM 骨干提供了一个原则性的、量化的方法,有可能节省大量的计算资源和时间。
排序理由 该集群包含一篇学术论文,详细介绍了用于预测 VLM 性能的新框架和实验结果。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- Capability-Driven Multimodal Scaling Law
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- LLM
- principal component analysis
- ScienceCast
- Vision--Language Models
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →