PulseAugur
实时 07:00:56
English(EN) COMET: Contrastive Motion-Enhanced Temporal Reasoning for Video Multimodal Large Language Models

COMET框架通过增强的运动和时序推理能力提升视频大语言模型

研究人员开发了COMET,一个旨在通过改进对细粒度运动和时序推理的理解来增强视频多模态大语言模型的新框架。该框架引入了一个专门的时序运动分支,并通过交叉注意力机制将其发现整合到外观流中。COMET还采用了一种新颖的优化策略,该策略利用时序顺序作为直接学习信号,从而在Qwen3-VL-8B和InternVL2.5-8B等不同模型架构的以动作为中心和时序推理任务上取得了显著的性能提升。 AI

影响 增强了大语言模型在视频理解方面的能力,可能改进视频分析和生成方面的应用。

排序理由 该条目是一篇学术论文,详细介绍了一种用于视频多模态大语言模型的新框架。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

COMET框架通过增强的运动和时序推理能力提升视频大语言模型

报道来源 [1]

  1. arXiv cs.CL TIER_1 English(EN) · Chenghua Zhu, Zhaolu Kang, Qifan Shi, Siyan Wu, Kehan Jiang, Lei Wei, Lianyu Hu, Guangyuan Dong, Mingbo Yang, Rui Lu, Guibo Luo ·

    COMET:用于视频多模态大语言模型的对比运动增强时序推理

    arXiv:2608.21030v1 Announce Type: cross Abstract: Video multimodal large language models have advanced significantly, yet fine-grained motion-temporal understanding remains fragile. The core bottleneck is not only sparse frame sampling, but also the lack of a complete temporal mo…