PulseAugur
实时 09:17:15
English(EN) What Transfers from Text to Vision? Capability Scaling Laws and Transfer Dynamics for VLMs

新定律在训练前预测视觉-语言模型性能

研究人员开发了一个名为“能力驱动的多模态缩放定律”的新框架,用于在训练前预测视觉-语言模型(VLMs)的性能。该定律使用从 LLM 文本基准测试中提取的低维能力分数来模拟 VLM 准确性,并考虑每个骨干模型的特定转移和吸收率。对 34 个 LLM 训练的 150 多个 VLM 进行的实验表明,该框架可以准确地将性能从较小模型外推到较大模型,并预测整个训练轨迹。研究还发现,某些文本基准测试可能与多模态性能呈负相关,这表明存在基准测试博弈,并且基础 LLM 通常比指令调整模型更好的 VLM 骨干。 AI

影响 为选择 VLMs 的 LLM 骨干提供了一个原则性的、量化的方法,有可能节省大量的计算资源和时间。

排序理由 该集群包含一篇学术论文,详细介绍了用于预测 VLM 性能的新框架和实验结果。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新定律在训练前预测视觉-语言模型性能

报道来源 [1]

  1. arXiv cs.CL TIER_1 English(EN) · Ziran Li, Qiang Wang, Zhengyu Chen, Shanglin Lei, Borun Chen, Jingang Wang, Xunliang Cai ·

    What Transfers from Text to Vision? Capability Scaling Laws and Transfer Dynamics for VLMs

    arXiv:2608.00013v1 Announce Type: new Abstract: Choosing the right large language model (LLM) backbone is the most consequential decision when building a vision-language model (VLM), yet it remains fundamentally unprincipled: compute-based scaling laws fail to generalize across m…