PulseAugur
实时 05:49:29

New LAIP framework unlocks spatial grounding in audio-visual models

研究人员开发了一个名为LAIP的新框架,以改善大型视听检索模型中的空间定位。该框架利用音频线索为空间池化模块提供信息,使模型能够从中间视觉标记中提取局部声源信息,而这些信息否则将丢失。LAIP在AVSBench和AVATAR基准测试中取得了最先进的性能,证明了可以从现有的检索表示中解锁精确的定位。 AI

影响 增强了视听模型精确定位声源的能力,有可能改进机器人和增强现实等应用。

排序理由 该集群包含一篇详细介绍新框架及其在基准测试中性能的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

New LAIP framework unlocks spatial grounding in audio-visual models

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Hugo Malard, Michel Olvera, Sanjeel Parekh, Ga\"el Richard, Slim Essid, St\'ephane Lathuili\`ere ·

    大型视听检索模型中的空间接地解锁

    arXiv:2607.24786v1 Announce Type: cross Abstract: Weak supervision sets a practical regime for audio-visual sound source localization as dense spatial annotations are costly to obtain at scale. The task, however, remains challenging, as models must locate sound sources from tempo…