PulseAugur
实时 07:28:08
English(EN) What Color Is the Text? A Benchmark for Hallucination Induced by Image-Embedded Prompt

新基准揭示多模态大语言模型在视觉输入下会产生文本颜色幻觉

研究人员开发了一个名为Embedded Stroop的新基准测试,用于测试多模态大语言模型(MLLMs)如何受到嵌入图像中的文本的影响。该基准测试利用“文本是什么颜色”(WCIT)数据集,评估模型在视觉呈现时区分文本颜色与文本本身语义意义的能力。虽然模型在命名特定颜色方面准确率较低,但它们表现出明显的幻觉倾向,报告嵌入词的颜色而不是实际文本的颜色,这种现象可以通过改变文本的呈现方式来减少。 AI

影响 突出了MLLMs的一个特定漏洞,可能影响未来的模型开发和评估方法。

排序理由 该集群包含一篇学术论文,详细介绍了用于评估MLLMs的新基准和数据集。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新基准揭示多模态大语言模型在视觉输入下会产生文本颜色幻觉

报道来源 [1]

  1. arXiv cs.CV TIER_1 English(EN) · Jinkun Zhao, Lei Huang, Haixin Ge, Wenjun Wu ·

    文字是什么颜色?图像嵌入提示引起的幻觉基准测试

    arXiv:2511.13400v3 Announce Type: replace Abstract: We introduce Embedded Stroop, a controlled diagnostic paradigm for measuring image-embedded prompt interference in Multimodal Large Language Models (MLLMs), where the query is rendered directly inside the visual input. Using the…