研究人员推出了EvoGenUI-Bench,这是一个旨在评估大型语言模型(LLM)作为多轮生成式UI助手能力的新基准。该基准包含150个跨越三个场景的五轮任务:信息呈现、可执行交互和工具驱动的外部状态。评估涉及在浏览器中执行生成的产物,并通过各种指标进行评估,包括轮次成功率、回合完成率和跨轮保留率。即使是表现最好的模型也面临挑战,最强的模型在五轮回合中仅达到74.9%的轮次通过率和37.3%的回合完成率,这凸显了在产物演变过程中保持同步界面行为、派生状态和外部状态的挑战。 AI
影响 强调了LLM驱动的UI生成当前存在的局限性,为未来在维护状态和一致性方面的发展指明了方向。
排序理由 一项介绍LLM能力基准的新学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →