研究人员推出了 Desktop-Delta Bench (DDB),这是一个旨在评估计算机使用代理 (CUA) 对图形用户界面 (GUI) 过渡理解能力的新基准。DDB 由来自 Linux 轨迹的 2,000 多个经人类验证的实例组成,侧重于状态验证、源跟踪和上下文感知控制。对八个模型系列的初步评估显示出持续的性能差距,当前模型在准确排序 GUI 状态和推断操作方面存在困难,这凸显了超越端到端任务成功的诊断能力改进需求。 AI
影响 该基准旨在提高与桌面 GUI 交互的 AI 代理的可靠性和恢复能力。
排序理由 该集群包含一篇介绍新基准以评估 AI 模型的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- CatalyzeX
- CUAS
- DagsHub
- Desktop-Delta Bench
- Deutsche Digitale Bibliothek
- Gotit.pub
- Hugging Face
- Linux
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →