实体
JigShape
JigShape
PulseAugur coverage of JigShape — every cluster mentioning JigShape across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
新基准揭示多模态大语言模型在多步空间推理方面存在困难
一个名为 LEGO-Puzzles 的新基准已被开发出来,用于评估多模态大语言模型(MLLMs)的多步空间推理能力。研究人员发现,即使是最先进的 MLLMs 在基本空间理解和规划任务上也表现不佳,其表现远逊于人类。随着空间推理所需复杂性和步骤的增加,这些模型的性能会迅速下降,凸显了它们当前能力的重大局限性。
-
新的JigShape基准揭示了视觉语言模型在几何推理方面的局限性
开发了一个名为JigShape的新基准来评估视觉语言模型(VLMs)的视觉-几何推理能力。该基准使用相互咬合的拼图块来创建明确的地面真实性,与之前使用矩形切割的方法不同。初步测试显示,包括GPT-5.5在内的大多数前沿模型在零样本几何推理方面存在显著困难,即使在小型拼图上的表现也仅相当于随机猜测。虽然监督微调可以提高在简单网格上的性能,但所有模型在大型拼图上都会崩溃,这表明当前在复杂性增加时维持约束满足方面存在架构限制。