PulseAugur
实时 08:02:09
English(EN) JigShape: Evaluating Visual-Geometric Reasoning in VLMs through Jigsaw Puzzles

新的JigShape基准揭示了视觉语言模型在几何推理方面的局限性

开发了一个名为JigShape的新基准来评估视觉语言模型(VLMs)的视觉-几何推理能力。该基准使用相互咬合的拼图块来创建明确的地面真实性,与之前使用矩形切割的方法不同。初步测试显示,包括GPT-5.5在内的大多数前沿模型在零样本几何推理方面存在显著困难,即使在小型拼图上的表现也仅相当于随机猜测。虽然监督微调可以提高在简单网格上的性能,但所有模型在大型拼图上都会崩溃,这表明当前在复杂性增加时维持约束满足方面存在架构限制。 AI

影响 突显了当前视觉语言模型在执行复杂几何推理方面的重大差距,表明需要架构上的进步。

排序理由 介绍用于评估AI模型新基准的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的JigShape基准揭示了视觉语言模型在几何推理方面的局限性

报道来源 [1]

  1. arXiv cs.CV TIER_1 English(EN) · Shawn Li, Wei Yang, Jike Zhong, Jiate Li, Jiawei Yang, You Qin, Ryan Rossi, Franck Dernoncourt, Roger Zimmermann, Yue Wang, Zhengzhong Tu, Vicente Ordonez, Mohit Bansal, Yue Zhao ·

    JigShape:通过拼图评估视觉语言模型(VLMs)中的视觉几何推理能力

    arXiv:2607.27670v1 Announce Type: new Abstract: Jigsaw puzzle solving requires jointly reasoning about visual content and geometric constraints, yet existing benchmarks use rectangular cuts that create ambiguous ground truth in texture-repeated regions. We introduce \textit{\ours…