发表在arXiv上的一项新研究挑战了视觉模型能像人类一样准确表征城市场景的假设。研究人员发现,尽管DINOv2 ViT-B等模型可以高精度地预测人类对街道场景的评估评分(最高可达r = 0.87),但它们的内部表征与人类感知脑电图(EEG)记录的神经数据并不一致。表现最好的模型仅解释了29.6%的可解释神经几何结构,并且这种一致性并未提高评估预测的准确性。这表明在评分任务中高预测准确性可能不是衡量这些模型对视觉场景理解程度的可靠指标。 AI
影响 挑战了评估视觉模型对视觉场景理解能力的当前基准的可靠性。
排序理由 该集群包含一篇发表在arXiv上的研究论文,详细介绍了关于AI模型表征的发现。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- Berlin
- CatalyzeX
- DagsHub
- DINOv2 ViT-B
- electroencephalography
- Gotit.pub
- Hugging Face
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →