研究人员推出 AnTrap,一个旨在评估 Android GUI 代理在运行时异常情况下的鲁棒性的新基准。该基准将现实世界中的异常分为四层和十个子类别,创造了逼真的对抗条件。对 16 个领先 GUI 模型的评估显示,所有模型的性能均显著下降,表明存在普遍漏洞。虽然对抗性强化学习可以解决一些异常问题,但状态死锁等更深层次的上下文问题仍然具有挑战性。 AI
影响 凸显了当前 GUI 代理的关键漏洞,可能推动对更鲁棒的移动应用 AI 系统的研究。
排序理由 介绍新基准和对现有模型进行评估的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →