研究人员开发了CRATE,一个用于评估语言引导的移动代理的新两阶段框架。该框架使用视觉语言模型(VLM)作为裁判,以步级方式处理轨迹,以推理后果和状态变化,而不是一次性处理整个轨迹。CRATE关注任务完成和操作安全,并有一个名为CRATE-S的扩展,专门用于安全评估。实验表明,CRATE在任务完成基准测试中取得了高精度,优于现有方法,而CRATE-S在安全基准测试中表现出高度一致性。 AI
影响 该框架可以改进用于移动应用程序的AI代理的开发和安全测试。
排序理由 该集群包含一篇研究论文,详细介绍了用于评估AI代理的新框架。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →