PulseAugur
实时 05:50:16
Svenska(SV) Desktop-Delta Bench: Do Computer-Use Models Understand Desktop GUI Transitions?

新的 Desktop-Delta Bench 评估 AI 代理的 GUI 理解能力

研究人员推出了 Desktop-Delta Bench (DDB),这是一个旨在评估计算机使用代理 (CUA) 对图形用户界面 (GUI) 过渡理解能力的新基准。DDB 由来自 Linux 轨迹的 2,000 多个经人类验证的实例组成,侧重于状态验证、源跟踪和上下文感知控制。对八个模型系列的初步评估显示出持续的性能差距,当前模型在准确排序 GUI 状态和推断操作方面存在困难,这凸显了超越端到端任务成功的诊断能力改进需求。 AI

影响 该基准旨在提高与桌面 GUI 交互的 AI 代理的可靠性和恢复能力。

排序理由 该集群包含一篇介绍新基准以评估 AI 模型的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的 Desktop-Delta Bench 评估 AI 代理的 GUI 理解能力

报道来源 [1]

  1. arXiv cs.AI TIER_1 Svenska(SV) · Abhishek Pillai, Samir Kumar Nayak, Yuan Chen ·

    Desktop-Delta Bench:计算机使用模型是否理解桌面 GUI 过渡?

    arXiv:2607.26041v1 Announce Type: new Abstract: Computer-use agents (CUAs) increasingly act through desktop GUIs to complete long-horizon tasks. Current benchmarks primarily measure end-task success or single-frame grounding. Neither isolates whether a model can reconstruct the c…