PulseAugur
中
实时 18:45:22
实体 GUI agents

GUI agents

PulseAugur coverage of GUI agents — every cluster mentioning GUI agents across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
26
90 天内 26
发布 · 30天
0
90 天内 0
论文 · 30天
26
90 天内 26
层级分布 · 90 天
主题
关系
情绪 · 30 天

3 天有情绪数据

最近 · 第 1/2 页 · 共 26 条
  1. TOOL · CL_268695 ·

    新的GUI-Hopper方法通过内嵌链接增强移动代理

    研究人员开发了一种名为GUI-Hopper的新方法,以提高移动GUI代理的效率。该方法将应用内嵌链接与点击和滑动等传统GUI操作相结合。通过使用内嵌链接进行直接导航,GUI-Hopper可以取代冗长的逐屏交互序列,从而提高商业应用中的任务成功率。

  2. TOOL · CL_245661 ·

    新的TRACE框架通过视觉标记修剪提高GUI代理效率

    研究人员开发了TRACE,一个旨在提高GUI代理效率的新框架。TRACE解决了由代理轨迹中的高分辨率屏幕截图引起的延迟和内存使用增加的挑战。它采用一种无需训练的方法,根据交互先验、指令相关性和特征新颖性来优先考虑视觉证据。这种方法确保保留的视觉信息可重用,并保持空间覆盖范围而无需重新编码,最终降低了各种GUI基准测试的计算成本。

  3. TOOL · CL_253049 ·

    TRACE框架通过新颖的证据排序提高GUI代理效率

    一个名为TRACE的新框架已被开发出来,通过减少延迟和内存使用来提高GUI代理的效率。TRACE通过根据未来效用和多样性对视觉证据进行排名,为空间覆盖保留令牌,并收缩已退休的帧来实现这一点。这种无需训练的方法确保了丢弃的视觉证据仍然可以对未来的目标有用,同时保持对重要区域的覆盖。在六个GUI基准上的大量实验表明,TRACE在预算紧张的情况下是有效的。

  4. TOOL · CL_233375 ·

    新系统为专业GUI代理工程化SOP

    研究人员开发了OmegaUse-SOP,一个旨在为专业计算机使用工程化标准操作程序(SOP)的新颖系统。这个以人为中心的系统将专家演示转化为GUI代理可重用的技能,解决了专业工作流程中隐性知识和任务特定约定带来的挑战。OmegaUse-SOP采用了一个四模块流程——观察(Observe)、推理(Reason)、配置(Configure)和执行(Execute)——将低级事件抽象为语义指令,整合领域规则,并通过分步对齐和验证来确保技能的…

  5. TOOL · CL_218392 ·

    新的Chameleon框架利用了动态环境中GUI代理的漏洞

    研究人员开发了一个名为Chameleon的新攻击框架,旨在利用在动态在线环境中运行的GUI代理的漏洞。现有的环境注入攻击(EIA)方法通常不切实际,未能考虑到网页内容的不断变化。Chameleon通过使用LLM驱动的环境模拟来生成多样化的网页模拟,并采用注意力黑洞机制来优化触发器并提高代理对无关内容的鲁棒性,从而解决了这一问题。在多个网站和LVLM驱动的GUI代理上的评估表明,Chameleon的性能明显优于先前的方法。

  6. RESEARCH · CL_218904 ·

    新基准 AnTrap 揭示 Android GUI 代理普遍存在的漏洞

    研究人员开发了 AnTrap,这是一个旨在评估 Android GUI 代理在运行时异常情况下的鲁棒性的新基准。该基准将动态扰动注入代理执行轨迹,并将现实世界的异常分为四个层次:状态、思考、动作和轮次。对 16 个领先 GUI 模型的评估显示,所有模型在性能上都有显著下降,表明它们普遍存在对这些异常的漏洞。虽然一些异常可以通过对抗性强化学习来解决,但诸如状态死锁等更深层次的上下文问题暴露了当前训练方法无法克服的内在局限性。

  7. RESEARCH · CL_217752 ·

    新的 KV 缓存压缩技术旨在提升 LLM 长上下文性能

    研究人员正在开发新的方法来压缩大型语言模型中的键值(KV)缓存,这是长上下文推理的主要瓶颈。Minima-KV 采用混合格式方法,将最近的页面存储在 FP8 中,将较旧的页面存储在 TQ3 中,以实现显著压缩。ST-Lite 通过解决视觉冗余和 UI 元素结构来针对 GUI 代理,性能优于现有方法。PuzzleKV 采用逐页低秩分解,将每页视为独立的压缩单元,以在减少存储的同时保持性能。Sigmoid Attention 探索了注意力…

  8. TOOL · CL_195676 ·

    新的门控滞后蒸馏增强了GUI代理的训练

    研究人员开发了一种名为门控滞后蒸馏(GHD)的新训练技术,以提高GUI代理的性能。GHD在训练期间利用未来的截图作为特权信息,使代理即使在即时反馈不足的情况下也能学习正确的推理。该方法解决了标准模仿学习中的一个关键限制,即动作的关键原理仅在后续状态中才显而易见。在与视觉语言模型一起测试时,GHD在AndroidWorld和AndroidLab等基准数据集上展示了改进的任务成功率。

  9. TOOL · CL_145839 ·

    新的 Android GUI Agent 漏洞利用了多模态模型的弱点

    研究人员发现了一种针对由大型多模态模型驱动的 Android GUI Agent 的新型安全漏洞。这些 Agent 旨在感知屏幕内容并注入输入,但容易受到“动作重绑定”(Action Rebinding)攻击。恶意应用程序可以利用这些 Agent 中固有的观察-动作差距,劫持其执行并执行特权操作,而无需危险的权限。该攻击在劫持原子操作和编排未经授权的文件删除和短信发送等高影响利用方面取得了 100% 的成功率,同时逃避了商业恶意软件扫…

  10. TOOL · CL_133570 ·

    新的红队测试方法利用 GUI 智能体漏洞

    研究人员开发了一种新的黑盒红队测试方法,称为语义级 UI 元素注入,用于测试 GUI 智能体的鲁棒性。该技术将无害的 UI 元素叠加到屏幕截图中,以误导智能体,绕过传统的安全措施,如白盒访问和提示注入防御。对 19 个模型的实验表明,这种策略性注入比随机方法更有效,即使在最初攻击成功后,也能显著地持续重定向智能体的注意力。

  11. TOOL · CL_128706 ·

    新指标揭示 GUI 代理优先考虑结构而非像素

    研究人员开发了一种名为感知-融合差距 (Perception-Fusion Gap) 的新指标,用于诊断多模态 GUI 代理如何形成关于其界面状态的信念。该指标衡量代理在遇到冲突信息时,在多大程度上依赖视觉像素而非结构化数据(如 DOM 或辅助功能树)。在来自三个供应商的五个模型中,代理倾向于优先选择结构化数据而非像素信息,这导致状态信念错误和后续任务失败。

  12. TOOL · CL_119560 ·

    新的 GUIDE 框架使用视频检索减少 GUI 代理中的领域偏差

    研究人员开发了 GUIDE,一个旨在减轻 GUI 代理中领域偏差的新颖框架。这个即插即用的系统利用实时网络视频检索和自动注释管道,在不改变现有参数或架构的情况下,为代理提供特定领域的知识。GUIDE 的方法包括分析教程视频的字幕以识别相关内容,然后利用这些信息来增强代理对 UI 元素和任务规划的理解,从而提高实际性能。

  13. TOOL · CL_115644 ·

    新的 GAIA 系统训练批评模型以提高 GUI 代理性能

    研究人员开发了 GAIA,一个数据飞轮系统,旨在通过训练直观批评模型 (ICM) 来提高 GUI 代理的性能。该 ICM 评估代理操作的正确性,选择成功概率更高的操作。然后,系统使用此批评模型收集精炼数据,进而训练出更强大的批评模型,形成一个自我改进的循环。实验表明,这种迭代过程提高了各种 GUI 代理的测试时性能。

  14. RESEARCH · CL_107916 ·

    VisCritic 框架通过视觉状态比较增强 GUI 代理

    研究人员推出了 VisCritic,一个新颖的视觉过程奖励框架,旨在提高 GUI 代理的性能。与以往仅依赖文本推理的方法不同,VisCritic 直接在视觉特征空间中比较动作前后的屏幕截图,以验证代理的动作。该方法利用了 Siamese 视觉 transformer 和一个动作感知 Critic Head 来评估动作成功率、任务进度和错误类型,提供了一个即插即用的解决方案,可改进基准指标并提供视觉诊断线索。

  15. TOOL · CL_77283 ·

    新的EVA框架演进GUI代理的语义攻击

    研究人员开发了EVA,一个旨在识别多模态大语言模型(MLLMs)驱动的GUI代理中语义漏洞的演进框架。该方法侧重于操纵代理的语义理解而非视觉感知,攻击成功率高达85%。EVA在模型的潜在空间中快速演进对抗性载荷,揭示了一个悖论:对齐训练反而可能使代理更容易受到欺骗性语义线索的影响。

  16. RESEARCH · CL_77162 ·

    StainFlow通过新颖的奖励模型改进GUI智能体训练

    研究人员引入了StainFlow,这是一种新颖的过程奖励模型,旨在增强GUI智能体的训练。该方法通过提供更精细的训练信号来解决强化学习中反馈稀疏的问题。StainFlow利用实体污点追踪来客观地分离任务阶段,并动态链接局部证据以提高关键节点验证的准确性。

  17. RESEARCH · CL_72502 ·

    新的 DragOn 数据集提升 GUI 代理的拖放能力

    研究人员推出了 DragOn,这是一个新的基准和数据集,旨在提高 GUI 代理在处理基于拖拽的交互方面的性能。该数据集包含 286,000 张训练截图和 350 万个训练任务,涵盖四个领域:文本高亮、单元格选择、元素调整大小和滑块操作。对包括 GPT、Claude、Qwen 和 Kimi 在内的各种专有和开源模型进行的评估表明,在 DragOn 上进行微调可以增强它们在复杂拖放和类似 GUI 操作方面的能力。

  18. RESEARCH · CL_70430 ·

    新的基准测试在动态短视频平台上测试AI智能体

    研究人员推出了“LivingScreen”,这是一个旨在评估动态短视频平台上GUI智能体的新基准。与假设屏幕静态的先前基准不同,LivingScreen考虑了连续播放的内容,要求智能体就观察和交互做出实时决策。对当前前沿模型的评估显示,在成本准确性方面均未达到人类水平,常见故障包括观察时间不当,凸显了未来GUI智能体在观察控制方面需要改进。

  19. RESEARCH · CL_58867 ·

    新的基准和数据合成提升GUI代理的错误恢复能力

    研究人员开发了一个新的基准和数据合成框架,以提高GUI代理的错误恢复能力。该基准GUI-RobustEval包含1200多个测试用例,用于系统地衡量代理从自身错误中恢复的程度。此外,一个名为RoTS的框架生成了80万个数据点,用于训练代理处理各种错误模式及其相应的恢复步骤。使用这些数据微调的模型,如RoTS-32B,已显示出显著的性能提升,并在OSWorld等基准测试中取得了最先进的成果。

  20. RESEARCH · CL_56344 ·

    MaskClaw系统为GUI代理提供边缘侧隐私保护

    研究人员开发了MaskClaw,这是一种新颖的、面向GUI代理的边缘侧隐私仲裁器。该系统旨在通过在数据发送到云端之前在本地做出隐私决策来保护屏幕截图中的敏感信息。MaskClaw利用本地视觉证据和用户特定策略来决定在处理屏幕截图之前是允许、屏蔽还是请求确认,从而增强依赖屏幕数据的应用程序的隐私性。