一个名为 FigCodeBench 的新基准已被开发出来,用于评估多模态大语言模型(MLLMs)复现复杂视觉图形和生成相应代码的能力。该框架通过整合视觉理解和代码生成,超越了孤立的评估,解决了当前基准的空白。在包括 Gemini-3.1 Pro 和 GPT-5.4 在内的 24 个专有和开源 MLLMs 上进行的实验,揭示了它们在各种编程语言和难度级别上的显著性能下降,为理解它们的局限性提供了见解。 AI
影响 凸显了当前多模态大语言模型在复杂视觉到代码任务方面的局限性,可能指导未来的模型开发。
排序理由 介绍多模态大语言模型新基准和评估框架的新学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- Connected Papers
- DagsHub
- FigCodeBench
- Gemini-3.1 Pro
- Gotit.pub
- GPT-5.4
- Hugging Face
- Kimi K2.5
- Litmaps
- MLLMs
- ScienceCast
- scite Smart Citations
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →