研究人员推出 AnyTrack,一个旨在统一任意模态组合的视觉对象跟踪的新框架。与先前需要特定模态配对的方法不同,AnyTrack 采用模态感知交互模块 (MIM) 来动态集成不同输入并保持时空一致性。上下文理解模块 (CUM) 通过模拟视觉特征与目标位置之间的空间对应关系,进一步提高定位精度。该框架在实验中展示了最先进的性能,即使在模态缺失或不完整的情况下也是如此,并在扩展的多模态跟踪基准上得到了验证。 AI
影响 通过实现对不同和不完整数据模态的统一处理,增强了视觉对象跟踪的灵活性和性能。
排序理由 该条目是关于计算机视觉研究新框架的 arXiv 预印本。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- AnyTrack
- arXiv
- CatalyzeX
- Context Understanding Module
- DagsHub
- Gotit.pub
- Hugging Face
- Modality-aware Interaction Module
- Pingping Zhang
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →