研究人员开发了一个新的评估框架,使用游戏Hues and Cues来评估对比视觉语言模型(CVLMs)与人类之间的感知对齐。该框架将颜色单元映射到色度图,以计算100个单词词汇的感知距离。研究发现,虽然CVLMs可以复制人类对具体概念的偏见,但在抽象领域它们会产生分歧,表现出语义误分类或塌缩到默认的蓝色坐标。研究结果表明,精心策划的预训练数据集比海量、未策划的数据集在减少这些错位方面更有效,并强调目前的CVLMs仍然难以捕捉细微的人类色彩记忆。 AI
影响 凸显了当前AI在理解细微人类感知方面的局限性,表明需要更好的训练数据和评估方法。
排序理由 该集群包含一篇学术论文,详细介绍了一种新的AI模型评估方法。 [lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →