研究人员开发了MARS,一个旨在通过利用多模态大语言模型的多个层和自适应表示槽来增强文本-视频检索的新型框架。与通常将各种线索压缩到单个向量中的现有方法不同,MARS通过组合来自不同解码器层的隐藏状态来构建多个槽。这种方法允许更细致地比较文本和视频元素,实验证明在多个基准测试中取得了最先进的结果。该框架进一步纳入了一个硬负例感知的槽专业化目标,以改进判别性匹配线索的捕获,从而在直接基于相似度的检索和重排方面都取得了显著的收益。 AI
影响 通过实现对多模态数据更细粒度的分析,提高了文本-视频检索系统的精度。
排序理由 该集群包含一篇关于文本-视频检索新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- decoder layers
- hard-negative-aware slot specialization
- Hugging Face
- MARS
- Multimodal Large Language Models
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →