PulseAugur
实时 20:18:20
实体 ScreenSpot-Pro

ScreenSpot-Pro

PulseAugur coverage of ScreenSpot-Pro — every cluster mentioning ScreenSpot-Pro across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 7
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 7
层级分布 · 90 天
主题
情绪 · 30 天

3 天有情绪数据

最近 · 第 1/1 页 · 共 7 条
  1. TOOL · CL_233619 ·

    新的CA-OPD框架通过置信度感知蒸馏改进视觉语言模型

    研究人员开发了一个名为置信度感知策略内蒸馏(CA-OPD)的新框架,以改进自回归视觉语言模型。该方法通过利用教师置信度来纠正训练过程中不可靠的学生预测,从而解决累积误差问题。CA-OPD将知识转移与干预决策对齐,在纠正的位置提供直接监督,在保留的位置提供完整的预测分布。当应用于GUI定位和光学字符识别任务时,CA-OPD显著增强了Qwen3.5-0.8B基线模型,在ScreenSpot-Pro和OCRBench-v2 English等…

  2. RESEARCH · CL_215992 ·

    新基准测试探究视觉语言模型空间推理能力,揭示定位和关系理解的差距 · 跟踪 5 个来源

    研究人员正在开发新的基准测试和方法论,以更好地理解和诊断视觉语言模型 (VLM) 在空间推理方面的失败。一种名为 GUI-Primitives 的方法使用对比指令对来隔离在图形用户界面中理解空间关系方面的失败,揭示当前 VLM 在定位和特定的关系类型(如包含和遮挡)方面存在困难。另一项研究调查了 LLaVA-1.5 和 Qwen2.5-VL 等 VLM 的内部机制,发现精确的物体定位并非总是空间推理所必需的,空间推理遵循一个分阶段的从…

  3. RESEARCH · CL_193400 ·

    新AI方法通过自演化和反思增强GUI基础 · 跟踪4个来源

    研究人员正在开发先进的GUI视觉基础方法,使AI代理能够更好地与图形用户界面交互。一种方法,测试时自演化GUI视觉基础,使用探索、评估、反思和内化的闭环系统,在无需人工标签的情况下提高部署后适应性,准确率提高了7.4%。另一种方法,无幻觉GUI基础,将指令理解与定位分离,使用冻结的MLLM进行解析,并使用避免坐标回归的专用基础模型,在ScreenSpot-Pro和Mind2Web等基准测试中取得了显著的准确率提升。第三种技术,Look…

  4. TOOL · CL_119574 ·

    新的GUI-AIMA框架增强了多模态LLM的基础能力

    研究人员开发了GUI-AIMA,一个用于改进多模态大语言模型(MLLMs)中图形用户界面(GUI)基础的新型框架。这种基于注意力的方法将内在多模态注意力与逐块基础信号对齐,实现了更高效、数据量更少(data-light)的训练。GUI-AIMA-3B仅用509k个样本就达到了3B模型中的最先进性能,展示了显著的数据效率。

  5. RESEARCH · CL_90827 ·

    新方法提升 VLM 在 GUI 基础任务上的准确性 · 2 篇论文

    两篇新研究论文介绍了用于提高视觉语言模型 (VLM) 在 GUI 基础任务上的准确性和可靠性的新方法。第一篇论文《Trust the Right Teacher》提出了一种质量感知自蒸馏方法,通过使用正确性感知门控和概率缩放来处理不可靠的坐标-token 预测,从而优化教师信号。第二篇论文《VISTA》提出了一个视图一致性自验证训练框架,该框架利用 GUI 的多个语义等价视图来稳定强化学习并提高坐标生成准确性,在 Qwen 主干上取得…

  6. RESEARCH · CL_15512 ·

    新方法BAMI和AutoFocus改进了AI代理的图形用户界面基础

    研究人员开发了两种新的无训练方法BAMI和AutoFocus,以提高AI代理图形用户界面基础的准确性。BAMI通过粗粒度到细粒度的聚焦和候选选择来解决精度和歧义偏差,将TianXi-Action-7B模型在ScreenSpot-Pro基准上的性能从51.9%提高到57.8%。AutoFocus通过采用不确定性感知的主动视觉搜索来解决高分辨率界面中的分辨率差距,使用token级困惑度来模拟空间不确定性,并改进了在ScreenSpot-P…

  7. RESEARCH · CL_08580 ·

    新方法纠正了多模态大语言模型因位置编码失败而产生的坐标预测偏差

    研究人员开发了一种名为 Vision-PE Shuffle Guidance (VPSG) 的新方法,以解决多模态大语言模型 (MLLM) 中坐标预测不准确的问题。这些模型在精确局部化方面常常遇到困难,尤其是在处理高分辨率图像时,位置编码可能会失效并引入可预测的偏差。VPSG 是一种在推理过程中应用的、无需训练的技术,它通过打乱位置编码并利用由此产生的信息来改进数字解码,从而减轻这些偏差。在 ScreenSpot-Pro 基准测试上的…