两篇新研究论文提出了改进AI代理图形用户界面(GUI)基础的准确性和可靠性的新方法。第一篇论文《通过无回归的布局感知匹配实现无幻觉的GUI基础》将指令理解与定位分离,使用冻结的多模态大型语言模型(MLLM)进行解析,并使用专用的基础模型进行精确元素识别,在ScreenSpot-Pro基准测试上实现了超过20%的改进。第二篇论文《LookAgain:具有视觉基础反射的闭环GUI基础》引入了一个闭环系统,该系统将坐标预测视为需要反思和通过预测-查看-再次-精炼过程进行改进的假设,在抗拒绝和通用GUI基础基准测试上展示了最先进的结果。 AI
影响 GUI基础领域的这些进步可能带来更强大、更可靠的AI代理,以实现跨各种应用的自动化任务。
排序理由 两篇在arXiv上发表的学术论文,提出了GUI基础的新方法。
在 Hugging Face Daily Papers 阅读 →
- arXiv
- graphical user interface
- GUI Grounding
- large-language models
- Layout-Aware GUI Grounding Model
- LookAgain
- Mind2Web
- MLLMs
- multimodal large language models
- ScreenSpot-Pro
AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →