研究人员推出了 IWC-Bench,这是一个新的交互式基准,旨在从软件测试的角度评估大型语言模型 (LLM) 生成的 Web 应用程序的质量。该基准通过使用代码覆盖率来指导代理探索应用程序功能,然后将交互跟踪抽象为状态转换图,从而解决了静态和现有交互式基准的局限性。IWC-Bench 在视觉美感、可用性和需求一致性方面评估应用程序,在对 16 个前沿 LLM 的评估中,与人类偏好达成 85.3% 的一致性。 AI
影响 该基准旨在改进对 LLM 生成的 Web 应用程序的评估,从而可能带来更强大、更用户友好的 AI 创建的软件。
排序理由 该集群包含一篇详细介绍用于评估 AI 生成软件的新基准的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →