研究人员推出了 MT-Web2Code,这是一个新颖的基准测试,旨在评估大型视觉语言模型 (LVLMs) 在复杂的多轮编码任务上的能力。该基准测试通过关注迭代过程,如重建缺失区域和修改 Web 界面内的局部元素,而不是仅仅进行整页生成,来解决现有工具的局限性。MT-Web2Code 包含 16 个领域的 102 项任务,并利用反向损坏轨迹引擎 (Reverse-Corruption Trajectory Engine) 来创建用于确定性评估的缺陷。初步实验表明,当前的编码代理在这些细微的任务上表现不佳,尤其是在多轮交互中保持代码完整性方面。 AI
影响 该基准测试有望推动能够执行更复杂和迭代式软件开发任务的 AI 代理的进步。
排序理由 该条目描述了一个新的 AI 模型基准测试和评估协议,发布在 arXiv 上。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- CORE Recommender
- DagsHub
- Gotit.pub
- Hugging Face
- Large Vision-Language Models
- MT-Web2Code
- Reverse-Corruption Trajectory Engine
- ScienceCast
- VLM-based rubric
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →