研究人员开发了LEAP,一个旨在改进长达一小时录音的音视频问答的新框架。LEAP通过将录音分割成块,并使用轻量级的定位通道来识别相关的短证据窗口,从而解决了上下文困境。然后,对这些选定的窗口进行重新编码以进行最终的问答通道,使输入和上下文独立于录音总时长。这种方法通过将原始流路由到问答阶段来保留细粒度的视觉和非语音音频证据,并支持流式推理的因果查询。 AI
影响 该框架有望实现对长格式音视频内容更高效、更有效的AI应用处理。
排序理由 该集群描述了一篇关于用于音视频感知的新颖框架的最新研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- LEAP
- MiniCPM-o 4.5
- Qwen3-Omni-30B-A3B
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →