一篇新发表在 arXiv 上的研究论文指出了当前视频语言模型(特别是 Gemini 3.6 Flash)存在的显著局限性。研究发现,这些模型在准确计数视频中的事件方面存在困难,尤其是在事件短暂或发生频率很高的情况下。虽然 Gemini 3.6 Flash 可以可靠地计数中等频率下多达 12 次的持续状态转换,但它无法准确计数眨眼事件,并且在高计数、高频率场景下的表现不佳。研究表明,即使提高视频采样率或改变提示策略,事件的表示方式和模型的时序推理能力仍然是关键瓶颈。 AI
影响 凸显了视频语言模型在时序推理和事件记录能力方面的关键局限性,表明当前模型尚未准备好应对复杂的现实世界视频分析任务。
排序理由 详细说明模型局限性的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →