研究人员开发了SportsGrounder,一个旨在提高大型多模态模型(LMMs)在分析密集体育视频时的推理能力的新框架。该框架通过引入领域引导的对象提案和交错式地面化融合机制,解决了区分视觉上相似的实体(如穿着相同队服的球员或球)的挑战。这种方法将显式的边界框坐标与隐式的视觉语义相结合,在不增加过多序列长度的情况下保持时间对齐。此外,还采用了一个动作感知监督模块,以确保模型学习准确的运动表示,减少对文本偏见的依赖,并使用混合偏好优化来更好地处理欺骗性干扰项。在新创建的密集体育视频问答(VQA)数据集上的实验表明,SportsGrounder显著增强了细粒度推理能力,并达到了最先进的准确率。 AI
影响 该框架可能带来更准确、更细致的体育视频分析,有益于运动员表现追踪和赛事转播的增强。
排序理由 该集群描述了一篇详细介绍用于AI视频分析的新颖框架的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- Action-Aware Supervision
- arXiv
- FineSports
- Hugging Face
- Interleaved Grounding Fusion
- Large Multimodal Models
- Mixed Preference Optimization
- SportsGrounder
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →