一项名为 SciFigBench 的新基准测试已被开发出来,用于评估视觉语言模型(VLM)在面对不完整或误导性科学图表时的行为可靠性。该基准测试评估感知、推理和行为方面,包含来自 250 张图表的 34,000 多个评估设置。还引入了容纳-抵抗-推断(A-R-I)框架,用于衡量模型在承认不确定性、抵抗误导性信息和谨慎推断方面的能力。结果表明,尽管 GPT-5.2 在描述质量和推理方面表现出色,但它经常出现幻觉,而 Gemini 3.1 Pro 则表现出更大的不确定性承认和对误导性数据的抵抗力。 AI
影响 强调了 VLM 需要展现超越单纯准确性的行为可靠性,这对于科学应用至关重要。
排序理由 该集群包含一篇介绍新颖的 AI 模型评估基准和框架的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →