研究人员开发了 AnTrap,这是一个旨在评估 Android GUI 代理在运行时异常情况下的鲁棒性的新基准。该基准将动态扰动注入代理执行轨迹,并将现实世界的异常分为四个层次:状态、思考、动作和轮次。对 16 个领先 GUI 模型的评估显示,所有模型在性能上都有显著下降,表明它们普遍存在对这些异常的漏洞。虽然一些异常可以通过对抗性强化学习来解决,但诸如状态死锁等更深层次的上下文问题暴露了当前训练方法无法克服的内在局限性。 AI
影响 强调了当前 GUI 代理训练的局限性,表明需要新的方法来处理复杂的运行时异常。
排序理由 该集群描述了一篇介绍基准和关于 AI 代理鲁棒性研究结果的新研究论文。
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →