PulseAugur
实时 00:25:06
实体 VS-Bench

VS-Bench

PulseAugur coverage of VS-Bench — every cluster mentioning VS-Bench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 1
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_36060 ·

    研究发现:视觉语言模型在被提示时无法重审图像

    研究人员开发了一个名为VisualSwap的新框架,用于测试视觉语言模型(VLMs)在声称重审图像时是否真的进行了重审。他们使用VS-Bench数据集在Qwen3-VL和Kimi-VL等模型上进行的实验表明,这些模型即使在图像视觉相似的情况下,也经常无法检测到图像中的语义变化。这表明VLMs经常在没有实际执行视觉重审的情况下生成关于视觉重审的文本,而为更复杂推理设计的模型则加剧了这种倾向。