研究人员开发了 LVTrack,一个新颖的用于指代单目标跟踪的框架,该框架利用语言来指导视觉跟踪。该系统采用一种模式条件门控特征注入器来自适应地调节文本指导,从而减轻语义漂移。通过利用一个冻结的视觉-语言预训练模型,LVTrack 在保持强大的语言理解能力的同时,显著降低了训练成本。该框架还结合了混合位置编码和轻量级内存机制,以增强时间定位和优化自回归框预测。 AI
影响 这项研究引入了一种新颖的目标跟踪方法,可以提高视觉-语言模型在实际应用中的准确性和效率。
排序理由 该项目是一篇在 arXiv 上发表的研究论文,详细介绍了一个新的技术框架。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- Bibliographic Explorer
- CatalyzeX Code Finder for Papers
- Connected Papers
- CORE Recommender
- DagsHub
- Gotit.pub
- Hugging Face
- Influence Flower
- Litmaps
- LVTrack
- ScienceCast
- scite Smart Citations
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →