Microsoft 开发了 Mage-VL,这是一种新颖的多模态基础模型,专为高效视频理解而设计。与处理每一帧的传统方法不同,Mage-VL 利用视频编解码器原理来关注“锚定”帧和预测的运动,显著减少了处理的视觉令牌数量。这种编解码器原生的设计可以将推理速度提高高达 3.5 倍,同时保持高精度,并且可以适应各种视频编解码器和分辨率。 AI
影响 该模型采用编解码器原生的方法,可能会显著加快实时视频分析和多模态人工智能应用程序的速度。
排序理由 Frontier-lab 模型发布,附带系统卡。[lever_c_demoted from frontier_release: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →