PulseAugur
实时 09:44:16
English(EN) GUI-Lens: Coarse-to-Fine Cropping for GUI Grounding with General-Purpose VLMs

GUI-Lens框架提升VLM在GUI基础上的准确性

研究人员开发了GUI-Lens,一个旨在提高视觉语言模型(VLMs)在GUI基础上的准确性的新框架。这种粗粒度到细粒度的裁剪方法允许通用VLMs通过迭代地聚焦于逐渐精炼的视图来精确地定位高分辨率界面上的交互元素。实验表明,GUI-Lens显著提高了基础准确性,与GPT-5.5等模型集成时达到了最先进的性能。 AI

影响 该框架可以提高与图形用户界面交互的AI代理的可靠性。

排序理由 这是一篇详细介绍GUI基础新框架的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

GUI-Lens框架提升VLM在GUI基础上的准确性

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Zichuan Fu, Shirong Wang, Wenlin Zhang, Guojing Li, Yimin Deng, Jingtong Gao, Junjia Qi, Hanyu Yan, Yefeng Zheng, Xiaopeng Li, Wanyu Wang, Xian Wu, Xiangyu Zhao ·

    GUI-Lens: Coarse-to-Fine Cropping for GUI Grounding with General-Purpose VLMs

    arXiv:2608.03270v1 Announce Type: cross Abstract: GUI grounding maps natural-language instructions to click locations and is essential for reliable GUI agents. The task remains difficult on high-resolution, densely populated interfaces because a vision-language model (VLM) may re…