一项名为Chart2Code的新基准测试已被推出,用于评估大型多模态模型(LMM)的图表理解和代码生成能力。该基准测试具有层级结构,包含三个难度递增的级别,旨在反映真实用户场景。Chart2Code包含2,023个任务,涵盖22种图表类型,并包含代码正确性和视觉保真度的指标。对包括GPT-5在内的25个最先进LMM进行的初步测试显示出显著的挑战,GPT-5在代码评估上的平均得分仅为0.57,在编辑任务的图表质量上的得分仅为0.22。 AI
影响 该基准测试的难度凸显了当前多模态推理的局限性,可能指导未来LMM在图表理解和代码生成方面的发展。
排序理由 一项介绍用于评估多模态模型的新颖基准测试的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →