ScreenSpot-V2
PulseAugur coverage of ScreenSpot-V2 — every cluster mentioning ScreenSpot-V2 across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新的GUI-AIMA框架增强了多模态LLM的基础能力
研究人员开发了GUI-AIMA,一个用于改进多模态大语言模型(MLLMs)中图形用户界面(GUI)基础的新型框架。这种基于注意力的方法将内在多模态注意力与逐块基础信号对齐,实现了更高效、数据量更少(data-light)的训练。GUI-AIMA-3B仅用509k个样本就达到了3B模型中的最先进性能,展示了显著的数据效率。
-
新方法利用空间线索提升VLM的GUI基础能力
研究人员开发了三种零样本辅助推理方法,以提高视觉语言模型(VLMs)在图形用户界面(GUIs)中的基础能力。这些方法通过在输入图像中提供明确的空间线索,如轴、网格和标记的交叉点,使VLMs能够在没有昂贵微调的情况下更好地阐述其隐式空间理解。在四个GUI基础任务基准和七个VLMs上的实验表明,性能显著提升,其中一种方法Mark-Grid Scaffold将Gemini-3.1-Pro在ScreenSpot-v2上的准确率从11.72%提…
-
新方法BAMI和AutoFocus改进了AI代理的图形用户界面基础
研究人员开发了两种新的无训练方法BAMI和AutoFocus,以提高AI代理图形用户界面基础的准确性。BAMI通过粗粒度到细粒度的聚焦和候选选择来解决精度和歧义偏差,将TianXi-Action-7B模型在ScreenSpot-Pro基准上的性能从51.9%提高到57.8%。AutoFocus通过采用不确定性感知的主动视觉搜索来解决高分辨率界面中的分辨率差距,使用token级困惑度来模拟空间不确定性,并改进了在ScreenSpot-P…