PulseAugur
实时 12:42:33
实体 SciFigBench

SciFigBench

PulseAugur coverage of SciFigBench — every cluster mentioning SciFigBench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_200055 ·

    新的基准测试 SciFigBench 旨在通过误导性科学图表测试 VLM 的可靠性

    一项名为 SciFigBench 的新基准测试已被开发出来,用于评估视觉语言模型(VLM)在面对不完整或误导性科学图表时的行为可靠性。该基准测试评估感知、推理和行为方面,包含来自 250 张图表的 34,000 多个评估设置。还引入了容纳-抵抗-推断(A-R-I)框架,用于衡量模型在承认不确定性、抵抗误导性信息和谨慎推断方面的能力。结果表明,尽管 GPT-5.2 在描述质量和推理方面表现出色,但它经常出现幻觉,而 Gemini 3.1…