引入了一个名为 ASCIITermDraw Bench 的新基准,用于评估视觉语言模型(VLMs)在生成和编辑 ASCII 图方面的能力。与侧重于编码或推理的基准不同,ASCIITermDraw-Bench 评估模型仅使用纯文本创建准确图表的能力,这与仅仅描述它们是不同的挑战。该基准包含四个类别的 80 个任务,包括基本布局、网络拓扑、软件架构和图像条件编辑,结果在结构和语义上进行评分。目前的排行榜结果显示 Gemma-4-31B-IT 以 73.8% 的领先,其次是 Qwen3.7-Plus 的 70.2%。 AI
影响 该基准可以推动视觉语言模型在视觉传达和图示推理能力方面的改进。
排序理由 引入用于评估 AI 模型的新基准。
- ASCIITermDraw Bench
- Gemma-4-31B-IT
- Kimi-K2.6
- MiniMax-M3
- Qwen3.5-9B
- Qwen3.7-Plus
- Ternary-Bonsai-27B
- Vision--Language Models
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →