PulseAugur
实时 09:43:59
English(EN) MT-Web2Code: Benchmarking Coding Agents on Multi-Turn Regional Reconstruction and Localized Modification

新的 MT-Web2Code 基准测试评估 AI 在迭代式 Web UI 编码任务上的表现

研究人员推出了 MT-Web2Code,这是一个新颖的基准测试,旨在评估大型视觉语言模型 (LVLMs) 在复杂的多轮编码任务上的能力。该基准测试通过关注迭代过程,如重建缺失区域和修改 Web 界面内的局部元素,而不是仅仅进行整页生成,来解决现有工具的局限性。MT-Web2Code 包含 16 个领域的 102 项任务,并利用反向损坏轨迹引擎 (Reverse-Corruption Trajectory Engine) 来创建用于确定性评估的缺陷。初步实验表明,当前的编码代理在这些细微的任务上表现不佳,尤其是在多轮交互中保持代码完整性方面。 AI

影响 该基准测试有望推动能够执行更复杂和迭代式软件开发任务的 AI 代理的进步。

排序理由 该条目描述了一个新的 AI 模型基准测试和评估协议,发布在 arXiv 上。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的 MT-Web2Code 基准测试评估 AI 在迭代式 Web UI 编码任务上的表现

报道来源 [1]

  1. arXiv cs.CV TIER_1 English(EN) · Qiming Li, Shujie Hu, Haohan Liu, Xiaocheng Feng, Songxiang Liu, Guanglu Wan ·

    MT-Web2Code: Benchmarking Coding Agents on Multi-Turn Regional Reconstruction and Localized Modification

    arXiv:2608.03474v1 Announce Type: new Abstract: Recent advances in Large Vision-Language Models (LVLMs) have demonstrated impressive capabilities in web UI generation. However, existing benchmarks predominantly focus on single-turn full-page generation from scratch, overlooking t…