PulseAugur
实时 09:26:47
实体 UXBench

UXBench

PulseAugur coverage of UXBench — every cluster mentioning UXBench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 3
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_93365 ·

    新基准评估LLM生成的UX评论的可操作性

    研究人员开发了UXBench,这是一个旨在评估大型语言模型(LLM)在评估用户体验(UX)评论方面的有效性的新基准。该基准包括跨各种产品表面的可运行Web固定装置和一个要求模型在生成报告前收集交互证据的系统。对八个前沿模型进行的评估结果表明,其UX评论的可操作性存在显著差异,模型在不同产品类别和评估方法中表现出独特的优势和劣势。

  2. TOOL · CL_86762 ·

    新的基准UXBench突显了MLLM在UI推理方面的局限性

    研究人员推出了一款名为UXBench的新基准,旨在评估多模态大语言模型(MLLM)在多大程度上能够基于UI截图进行用户体验(UX)推理。该基准包含8个任务的2000个VQA数据样本,评估布局、视觉层次结构和内容一致性等问题。对现有MLLM的评估揭示了其在基于UI推理方面存在显著局限性,促使了UI-UX的开发,这是一款使用Qwen3-VL-4B-Thinking基础模型并通过强化学习增强的MLLM。UI-UX在UXBench上取得了最先…

  3. RESEARCH · CL_79554 ·

    新的UXBench基准测试评估AI助手用户体验

    研究人员推出UXBench,这是一个旨在评估AI助手用户体验的新型基准测试。该基准测试是第一个使用真实用户反馈信号的基准测试,包含三个任务:UX Judge、UX Eval和UX Recovery。它建立在一个包含7400个实例的数据集之上,这些实例来源于一个中国AI助手的70000多条交互日志,涵盖了各种场景和失败模式。对26个语言模型的实验表明,用户反馈预测是一项可学习的能力,并突出了当前LLM作为裁判的评估方法中的偏见。