PulseAugur
实时 08:11:15
English(EN) Automated Trajectory Evaluation for Mobile Agents via Step-Level Consequence Reasoning and Aggregation

新的CRATE框架通过步级推理增强移动代理评估

研究人员开发了CRATE,一个用于评估语言引导的移动代理的新两阶段框架。该框架使用视觉语言模型(VLM)作为裁判,以步级方式处理轨迹,以推理后果和状态变化,而不是一次性处理整个轨迹。CRATE关注任务完成和操作安全,并有一个名为CRATE-S的扩展,专门用于安全评估。实验表明,CRATE在任务完成基准测试中取得了高精度,优于现有方法,而CRATE-S在安全基准测试中表现出高度一致性。 AI

影响 该框架可以改进用于移动应用程序的AI代理的开发和安全测试。

排序理由 该集群包含一篇研究论文,详细介绍了用于评估AI代理的新框架。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的CRATE框架通过步级推理增强移动代理评估

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Pengshuai Yang, Zijing Gao, Xue Yu, Benhui Zhuang, Bo Yuan, Junlan Feng ·

    通过步级后果推理与聚合实现移动体轨迹的自动化评估

    arXiv:2608.20797v1 Announce Type: new Abstract: Evaluating language-guided mobile agents has recently shifted from rule-based to model-based approaches to achieve scalable and automated assessments. However, existing holistic evaluation paradigms process entire trajectories at on…