两篇新研究论文介绍了语言模型中视听事件感知的新方法。第一篇ST-OmniQA提出了一个用于移动声源的时空视听推理基准,以及一个名为ST-Omni-R1的模型,该模型集成了视听上下文以改进事件识别和跟踪。第二篇SCoPE提供了一个无需训练的框架,通过利用稀疏的跨模态先验交换,让模态相互引导,从而减轻虚假共激活,增强视听事件感知。 AI
影响 这些进展可能带来更复杂的、能够更深入理解视频中动态事件的多模态AI系统。
排序理由 两篇在arXiv上发表的学术论文,介绍了新的视听事件感知基准和框架。
- alphaXiv
- arXiv
- AV$^2$A
- CatalyzeX
- CLAP
- Connected Papers
- DagsHub
- Gotit.pub
- Hugging Face
- Litmaps
- OV-AVEBench
- ScienceCast
- Scite
- SCoPE
- ST-OmniQA
- ST-Omni-R1
- VGGSound-AVEL100k
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →