PulseAugur
中
实时 02:25:15
实体 MUSIC-AVQA-R

MUSIC-AVQA-R

PulseAugur coverage of MUSIC-AVQA-R — every cluster mentioning MUSIC-AVQA-R across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
  1. TOOL · CL_198317 ·

    Qwen-MusicAVQA-7B模型以高效设计增强音乐视听问答能力

    研究人员开发了Qwen-MusicAVQA-7B,一个专为音乐视听问答设计的​​多模态模型。该模型使用学习到的线性投影,有效地将一个冻结的Whisper音频编码器与Qwen2-VL-7B-Instruct语言模型连接起来。该系统在MUSIC-AVQA基准测试中表现强劲,准确率达到96.0%,并强调了在有效的视听问答中保留音频表示中细粒度时间信息的重要性。

  2. TOOL · CL_128860 ·

    Q-TriM框架通过并行注意力增强视听问答

    研究人员开发了Q-TriM,一种用于视听问答(AVQA)的新型框架,它利用浅层并行注意力机制,而不是深层顺序堆叠。该方法旨在通过以文本查询为条件来处理视频和音频,从而减轻信息丢失和跨层错误累积。Q-TriM在多个AVQA基准测试中展示了最先进的性能,包括在MUSIC-AVQA-R上取得显著改进,突显了其有效性和泛化能力。