一项新的研究论文识别出音频-视觉大语言模型(AV-LLMs)中一种名为“先验主导”的显著失败模式。当模型的内部决策过程,尤其是在晚期层中,即使在呈现冲突的音频和视觉信息时,也过度倾向于偏好的答案模式时,就会发生这种情况。研究发现,在这些跨模态冲突场景下,像VideoLLaMA 2-7B-AV和InternVideo2这样的模型准确率下降,指令遵循失败增加。虽然时间对齐会影响答案偏差,但它并不能解决这种根本性的组合泛化问题。 AI
影响 突出了当前音频-视觉大语言模型的一个关键限制,表明需要改进组合泛化能力。
排序理由 该集群包含一篇学术论文,详细介绍了音频-视觉大语言模型中的一种特定失败模式。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →