研究人员调查了多模态大语言模型(MLLMs)在呈现双稳态图像(如经典的鸭兔图)时是否表现出类似人类的报告行为。研究使用了 LLaVA 系列模型,探讨了视觉线索和语言先验如何影响模型响应,发现这些因素会系统性地改变报告,这与人类感知一致。模型也像人类一样,主要倾向于单一解释,其内部计算涉及竞争性的图像-标记表示和不同的调制通路。 AI
影响 研究了 MLLMs 如何处理模糊的视觉信息,可能为未来开发更具细微感知能力的模型提供参考。
排序理由 学术论文,详细介绍了 MLLMs 在双稳态图像方面的行为研究。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- duck-rabbit
- Gotit.pub
- Hugging Face
- Llava
- ScienceCast
- Visual Anagrams
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →