研究人员探索了在中期训练大型语言模型时使用原始视频数据(无字幕或文本监督)的有效性。通过将视频帧编码为视觉标记,并训练语言模型来预测下一个视觉标记,他们发现在视频和图像基准测试中都有显著的改进。与未经此中期训练的模型相比,中期训练的Qwen3-1.7B模型在视频任务上提高了2.9分,在图像任务上提高了5.1分。值得注意的是,文本性能保持稳定,而视觉任务上的提升在训练早期就出现了。 AI
影响 这项研究提出了一种新颖的、自监督的方法,利用原始视频来增强多模态LLM,有可能减少对昂贵的基于文本的标注的依赖。
排序理由 该集群描述了一篇在arXiv上发表的研究论文,其中详细介绍了一种新的语言模型训练方法。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →