PulseAugur
实时 08:01:08
实体 EvoGenUI-Bench

EvoGenUI-Bench

PulseAugur coverage of EvoGenUI-Bench — every cluster mentioning EvoGenUI-Bench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_228693 ·

    新基准测试LLM作为多轮生成式UI助手

    研究人员推出了EvoGenUI-Bench,这是一个旨在评估大型语言模型(LLM)作为多轮生成式UI助手能力的新基准。该基准包含150个跨越三个场景的五轮任务:信息呈现、可执行交互和工具驱动的外部状态。评估涉及在浏览器中执行生成的产物,并通过各种指标进行评估,包括轮次成功率、回合完成率和跨轮保留率。即使是表现最好的模型也面临挑战,最强的模型在五轮回合中仅达到74.9%的轮次通过率和37.3%的回合完成率,这凸显了在产物演变过程中保持同…