ScreenSpot-Pro
PulseAugur coverage of ScreenSpot-Pro — every cluster mentioning ScreenSpot-Pro across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新的GUI-AIMA框架增强了多模态LLM的基础能力
研究人员开发了GUI-AIMA,一个用于改进多模态大语言模型(MLLMs)中图形用户界面(GUI)基础的新型框架。这种基于注意力的方法将内在多模态注意力与逐块基础信号对齐,实现了更高效、数据量更少(data-light)的训练。GUI-AIMA-3B仅用509k个样本就达到了3B模型中的最先进性能,展示了显著的数据效率。
-
新方法提升 VLM 在 GUI 基础任务上的准确性 · 2 篇论文
两篇新研究论文介绍了用于提高视觉语言模型 (VLM) 在 GUI 基础任务上的准确性和可靠性的新方法。第一篇论文《Trust the Right Teacher》提出了一种质量感知自蒸馏方法,通过使用正确性感知门控和概率缩放来处理不可靠的坐标-token 预测,从而优化教师信号。第二篇论文《VISTA》提出了一个视图一致性自验证训练框架,该框架利用 GUI 的多个语义等价视图来稳定强化学习并提高坐标生成准确性,在 Qwen 主干上取得…
-
新方法BAMI和AutoFocus改进了AI代理的图形用户界面基础
研究人员开发了两种新的无训练方法BAMI和AutoFocus,以提高AI代理图形用户界面基础的准确性。BAMI通过粗粒度到细粒度的聚焦和候选选择来解决精度和歧义偏差,将TianXi-Action-7B模型在ScreenSpot-Pro基准上的性能从51.9%提高到57.8%。AutoFocus通过采用不确定性感知的主动视觉搜索来解决高分辨率界面中的分辨率差距,使用token级困惑度来模拟空间不确定性,并改进了在ScreenSpot-P…
-
新方法纠正了多模态大语言模型因位置编码失败而产生的坐标预测偏差
研究人员开发了一种名为 Vision-PE Shuffle Guidance (VPSG) 的新方法,以解决多模态大语言模型 (MLLM) 中坐标预测不准确的问题。这些模型在精确局部化方面常常遇到困难,尤其是在处理高分辨率图像时,位置编码可能会失效并引入可预测的偏差。VPSG 是一种在推理过程中应用的、无需训练的技术,它通过打乱位置编码并利用由此产生的信息来改进数字解码,从而减轻这些偏差。在 ScreenSpot-Pro 基准测试上的…