研究人员推出了Vector-Bench,这是一个旨在评估AI模型精确编辑可缩放矢量图形(SVG)代码能力的新基准测试。该基准测试包含40个具有挑战性的任务,每个任务将一个损坏的SVG与视觉指令和隐藏的目标程序配对。Vector-Bench评估模型在保持代码其他部分不变的情况下进行所需更改的能力,使用确定性奖励规范,该规范考虑了修复的可感知容差和未请求元素的语义完整性。对34个模型端点的评估显示,即使是最强大的模型,在完全满足规范方面也仅达到15.0%的成功率,这凸显了表面修复进展与忠实编辑之间存在的显著差距。 AI
影响 凸显了当前AI模型在精确代码编辑方面的局限性,可能指导未来在结构化数据操作方面的研究。
排序理由 该集群描述了在arXiv上发布的新基准测试和研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- Influence Flower
- ScienceCast
- SVG
- Vector-Bench
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →