研究人员开发了一个名为Embedded Stroop的新基准测试,用于测试多模态大语言模型(MLLMs)如何受到嵌入图像中的文本的影响。该基准测试利用“文本是什么颜色”(WCIT)数据集,评估模型在视觉呈现时区分文本颜色与文本本身语义意义的能力。虽然模型在命名特定颜色方面准确率较低,但它们表现出明显的幻觉倾向,报告嵌入词的颜色而不是实际文本的颜色,这种现象可以通过改变文本的呈现方式来减少。 AI
影响 突出了MLLMs的一个特定漏洞,可能影响未来的模型开发和评估方法。
排序理由 该集群包含一篇学术论文,详细介绍了用于评估MLLMs的新基准和数据集。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Embedded Stroop
- Hugging Face
- Jinkun Zhao
- Multimodal Large Language Models (MLLMs)
- Stroop Hallucination Rate (SHR)
- What-Color-Is-the-Text (WCIT)
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →