研究人员开发了TraRA,一种用于视频文本识别的新方法,旨在提高城市监控场景下的准确性。与之前独立分析帧的方法不同,TraRA在整个轨迹中聚合文本识别。该方法使用时间聚类来分组连贯的文本实例,并使用增强了低秩自适应(Low-Rank Adaptation)的视觉语言模型来融合视觉和语言信息。TraRA在多个基准测试中都表现出改进的性能,即使在运动模糊和遮挡等挑战性条件下也是如此。 AI
影响 提高了现实世界视频监控中AI驱动的文本识别的准确性。
排序理由 arXiv上发布了关于新方法的学术论文。
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →