研究人员推出了Edit2TikZ,一个旨在评估多模态大型语言模型(MLLM)使用TikZ代码编辑科学图形能力的新基准。该基准包含1,548个样本,涵盖真实世界和合成编辑,支持文本和视觉定位请求,并具有带注释的多步编辑功能。对14个主流MLLM的评估显示,当前模型在编译成功率和保留无关内容方面存在困难,专有模型仅达到75%的编译成功率。为了解决这些局限性,研究人员开发了一个名为TikZEditMix的混合训练集和课程学习方法,显著提高了Qwen3.5-4B等紧凑型模型的性能。 AI
影响 强调了当前MLLM在精确代码生成任务中的局限性,可能为未来科学可视化模型的开发提供指导。
排序理由 该集群描述了一个新的基准和对现有模型在特定任务上的评估,符合研究类别。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →