PulseAugur
实时 19:40:37
English(EN) The model corrected reality

Gemini 3.5 Flash 在视觉输入时会幻觉出真实世界实体 · 跟踪到 1 个来源

最近的一项基准测试显示,谷歌的 Gemini 3.5 Flash 模型在遇到具有真实世界对应实体的输入时,表现出一种令人担忧的倾向,即产生似是而非但错误的信息。在涉及一个虚构的日本银行名称的测试中,即使输入完全清晰可辨,该模型也一贯地将其替换为真实且发音相似的银行名称“Mizuho Bank”。这种“先验捕获”现象,即模型的语言先验覆盖了视觉证据,在 Anthropic 的 Claude Fable-5 中并未观察到,该模型在所有测试分辨率下都能正确读取虚构名称。这个问题尤其隐蔽,因为虚构的信息通常比实际的虚构数据更具可信度,这使得在实际应用中难以检测。 AI

影响 突出了 LLM 视觉模型中一种关键的故障模式,即语言先验会覆盖视觉输入,可能导致在实际应用中出现无法检测的错误。

排序理由 该条目详细介绍了关于 LLM 行为的特定基准测试和观察结果,属于对模型能力和局限性的研究。 [lever_c_demoted from research: ic=1 ai=1.0]

在 dev.to — LLM tag 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

Gemini 3.5 Flash 在视觉输入时会幻觉出真实世界实体 · 跟踪到 1 个来源

报道来源 [1]

  1. dev.to — LLM tag TIER_1 English(EN) · Hideki Mori ·

    The model corrected reality

    <p>Here is the bank-transfer block from a Japanese invoice, rendered at 300 dpi. The fine print is 7.5 pt and every character is crisp. The bank is みずなら銀行 — a fictional institution I invented for a benchmark. It exists nowhere except in this document.</p> <p><a class="article-bod…