引入了一个名为MathGen的新基准来评估文本到图像(T2I)模型的数学能力。该基准包含七个领域共420个问题,揭示了当前的T2I模型在视觉表示数学概念方面存在显著困难。即使是表现最好的闭源模型,准确率也仅为53.7%,而开源模型的表现则很差,在需要精确几何和功能渲染的结构化任务上准确率常常接近0%。这表明T2I模型在基础数学视觉生成方面尚不可靠。 AI
影响 凸显了当前文本到图像模型在需要精确视觉数学表示的任务中的显著局限性。
排序理由 介绍新基准和现有模型评估的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- Clean Scene
- DagsHub
- Gotit.pub
- Hugging Face
- MathGen
- Open Scene
- Ruiyao Liu
- ScienceCast
- Script-as-a-Judge
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →