研究人员开发了一个名为文本细化与对齐(TRA)的新框架,以改进视频中的点监督时序动作定位。该框架通过整合文本描述的语义信息与视觉特征来增强现有方法。它利用了两个新颖的模块:一个基于点的文本细化模块(PTR),用于使用点标注和预训练模型来细化描述;以及一个基于点的多模态对齐模块(PMA),用于将视觉和文本特征投影到共享空间以实现更好的对齐。实验表明,TRA在THUMOS-14等基准测试中显著提升了性能,取得了具有竞争力的58.5% AVG mAP@[0.1:0.7]。 AI
影响 通过多模态特征对齐提高时序动作定位的准确性,从而增强视频分析能力。
排序理由 该集群包含一篇详细介绍时序动作定位新框架的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- Point-based Multimodal Alignment module (PMA)
- Point-based Text Refinement module (PTR)
- Text Refinement and Alignment (TRA)
- THUMOS-14
- Yunchuan Ma
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →