PulseAugur
实时 09:46:57
实体 VideoLLaMA 2-7B-AV

VideoLLaMA 2-7B-AV

PulseAugur coverage of VideoLLaMA 2-7B-AV — every cluster mentioning VideoLLaMA 2-7B-AV across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_227026 ·

    音频-视觉大语言模型展现“先验主导”失败模式

    一项新的研究论文识别出音频-视觉大语言模型(AV-LLMs)中一种名为“先验主导”的显著失败模式。当模型的内部决策过程,尤其是在晚期层中,即使在呈现冲突的音频和视觉信息时,也过度倾向于偏好的答案模式时,就会发生这种情况。研究发现,在这些跨模态冲突场景下,像VideoLLaMA 2-7B-AV和InternVideo2这样的模型准确率下降,指令遵循失败增加。虽然时间对齐会影响答案偏差,但它并不能解决这种根本性的组合泛化问题。