研究人员开发了一个名为Autoregressive Mosaics (AM-Bench)的新基准测试,用于评估纯文本大语言模型的二维空间推理能力。该基准测试包含一项翻译任务,模型为完全指定的几何图形生成代码;以及一项布局任务,评估模型根据不完全指定的提示组合图像的能力。结果表明,虽然所有测试模型都能将指定的几何图形翻译成代码,但它们在开放式布局任务上的表现差异很大,这表明除了代码生成能力之外还存在其他差异。研究还发现,与程序化代码相比,使用原始SVG作为输出媒介可以提高布局分数,并且模型在生成之前会制定一个粗略的布局计划,该计划在生成过程中会不断演变。 AI
影响 这项研究引入了一种评估大语言模型空间推理能力的新方法,有望指导未来模型开发朝着更好的视觉理解方向发展。
排序理由 该集群包含一篇详细介绍新AI模型评估基准的学术论文。
- AM Bench 2022 Macroscale Tensile Challenge at Different Orientations (CHAL-AMB2022-04-MaTTO)
- arXiv
- Autoregressive Mosaics
- SVG
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →