研究人员推出了一种新方法Latent-OPD,用于提高大型多模态模型(LMM)在视频推理方面的效率。该技术通过引入轨迹级潜在蒸馏来增强On-Policy Distillation(OPD),专注于推理轨迹末端的隐藏状态,以更好地捕捉累积的视觉证据。一种渐进式教师前瞻策略进一步将学生模型层与更深的教师层对齐。在六个视频推理基准上的实验表明,Latent-OPD的性能显著优于标准的仅输出OPD,尤其是在帧数有限、视频长或证据聚合任务复杂的情况下,从而实现了更帧高效的视频推理。 AI
影响 这项研究可能带来更高效、更强大的视频推理模型,降低复杂视觉分析任务的计算成本。
排序理由 该集群包含一篇详细介绍AI模型效率新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Deep Thought Alignment
- Large Multimodal Models
- Latent-OPD
- On-Policy Distillation
- Trajectory-Level Latent Distillation
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →