研究人员正在开发先进的GUI视觉基础方法,使AI代理能够更好地与图形用户界面交互。一种方法,测试时自演化GUI视觉基础,使用探索、评估、反思和内化的闭环系统,在无需人工标签的情况下提高部署后适应性,准确率提高了7.4%。另一种方法,无幻觉GUI基础,将指令理解与定位分离,使用冻结的MLLM进行解析,并使用避免坐标回归的专用基础模型,在ScreenSpot-Pro和Mind2Web等基准测试中取得了显著的准确率提升。第三种技术,LookAgain,采用视觉反思的闭环过程,将坐标预测视为一个假设,通过预测-查看-再次-精炼的循环进行修正,取得了最先进的结果。 AI
影响 GUI基础领域的这些进步可以显著提高AI代理与软件和Web界面交互的能力。
排序理由 多篇研究论文发表在arXiv上,详细介绍了GUI基础的新颖方法。
- arXiv
- graphical user interface
- GUI Grounding
- large-language models
- Layout-Aware GUI Grounding Model
- LookAgain
- Mind2Web
- MLLMs
- multimodal large language models
- ScreenSpot-Pro
- Contrastive Calibration
- GUI Visual Grounding
- Hallucination-Free GUI Grounding
- Hugging Face
- MLLM-based Reflector
- Reflection-Guided On-Policy Self-Distillation
- Test-Time Self-Evolving
AI 生成摘要 · Google Gemini · 来自 4 个来源。 我们如何撰写摘要 →