研究人员推出了ClearText-Video (CTVid),一个新大规模数据集,旨在评估多模态大语言模型 (MLLM) 在不同质量条件下处理以文本为中心的视频理解能力。CTVid包含超过4600个视频,拥有超过160万个人工验证的场景文本标注以及中英文问答对共22万个。该数据集包含视频的降质和修复版本,用于测试以文本为中心的视频修复和多质量视频问答,结果表明视觉增强并不总是能提高MLLM的文本保真度或推理性能。 AI
影响 该数据集将使研究人员能够更好地理解和提高MLLM在真实世界低质量视频数据上的性能。
排序理由 该条目描述了一个新的数据集和相关的研究论文,发布在arXiv上。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- ClearText-Video
- CTVid
- English
- MLLMs
- Multimodal Large Language Models and Tunings: Vision, Language, Sensors, Audio, and Beyond
- Multi-Quality VideoQA
- optical character recognition
- Standard Chinese
- Text-Centric Video Restoration
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →