实体
MUSIC-AVQA
MUSIC-AVQA
PulseAugur coverage of MUSIC-AVQA — every cluster mentioning MUSIC-AVQA across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
Qwen-MusicAVQA-7B模型以高效设计增强音乐视听问答能力
研究人员开发了Qwen-MusicAVQA-7B,一个专为音乐视听问答设计的多模态模型。该模型使用学习到的线性投影,有效地将一个冻结的Whisper音频编码器与Qwen2-VL-7B-Instruct语言模型连接起来。该系统在MUSIC-AVQA基准测试中表现强劲,准确率达到96.0%,并强调了在有效的视听问答中保留音频表示中细粒度时间信息的重要性。
-
新型SHRIKE模型利用场景图推进视听问答
研究人员推出SHRIKE,一个新颖的视听问答系统,该系统利用多模态场景图和基于Kolmogorov-Arnold网络(KAN)的专家混合(MoE)。这种方法显式地对视听场景中的对象及其关系进行建模,解决了现有方法在处理结构化视频信息和细粒度多模态特征建模方面的局限性。SHRIKE在MUSIC-AVQA和MUSIC-AVQA v2基准测试中取得了最先进的性能,展示了改进的时间推理和跨模态交互能力。