研究人员推出 ViTAL-X,这是一种旨在通过解决现有模型中普遍存在的时间盲点来改进视频-文本对齐的新模型。这种模型无法理解顺序和运动等基本时间线索的问题,通过一个名为 XTE-Bench 的新诊断工具得以凸显。ViTAL-X 采用一种名为跨模态时间编辑 (XTE) 的自监督框架来注入时间监督,使其能够以更少的参数和更少的数据训练,显著优于规模更大的模型。 AI
影响 提高了视频-文本模型的时间推理能力,有望增强需要理解序列和运动的应用。
排序理由 该集群描述了一篇详细介绍视频-文本对齐新模型和基准的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- CORE Recommender
- Cross-Modal Temporal Edits
- DagsHub
- Gotit.pub
- Hugging Face
- ScienceCast
- XTE-Bench
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →