研究人员开发了 Tri-PvP,这是一个旨在暴露全模态大语言模型 (OLLM) 模态偏见的新基准。该基准通过将感知信号(如图像或音频记录)与命题信号(陈述性语句)分开,解决了先前评估中的局限性,从而更清晰地了解 OLLM 如何处理跨视觉、音频和文本的冲突信息。对五个 OLLM 的初步评估显示出显著的视觉偏见以及一种系统性不对称,即模型在视觉上偏好感知证据,而在音频上偏好命题证据。进一步分析表明,这种偏见在模型早期层即可检测到,并且难以完全缓解。 AI
影响 这项研究通过识别和量化模态偏见,突出了改进多模态人工智能的关键领域,有望带来更强大、更可靠的 OLLM。
排序理由 该集群描述了一篇介绍用于评估大语言模型的新颖基准的学术论文。
- Audio
- Contrastive decoding
- dog
- layer-wise linear probing
- omni-modal large language models
- perceptual signals
- plain text
- propositional signals
- Tri-PvP
- visual perception
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →