Computer-Using Agents
PulseAugur coverage of Computer-Using Agents — every cluster mentioning Computer-Using Agents across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新的OSReward基准揭示VLM裁判对AI代理过于宽容
研究人员推出了OSReward,这是一个旨在评估视觉语言模型(VLM)作为计算机使用代理(CUA)裁判的可靠性的新基准。该基准包含一组多样化的CUA轨迹,其地面真实况判断来自多阶段的人工标注。研究结果表明,即使是最先进的VLM也表现出宽容偏差,将失败的CUA运行错误地归类为成功,并且最可靠的模型对于大规模使用来说成本过高。为解决此问题,该团队开发了OS-Shepherd,这是一系列开源奖励模型,在新的推理标注判断语料库上进行训练,提供…
-
新的OSReward基准揭示VLM裁判对AI代理存在宽容倾向
研究人员推出了OSReward,这是一个旨在评估视觉语言模型(VLM)作为计算机使用代理(CUA)裁判的可靠性的新基准。该基准包含跨多个平台的真实CUA轨迹,其地面真实判决来自多阶段的人工标注。初步评估显示,即使是最先进的VLM也表现出宽容偏差,将失败的任务错误地归类为成功,而最可靠的模型成本过高。为解决此问题,该团队开发了OS-Shepherd-100K,这是一个带标注判决的开放语料库,并训练了OS-Shepherd奖励模型,这些模…
-
新基准揭示AI代理难以处理真实的SaaS任务
研究人员推出了SaaS-Bench,这是一个旨在评估计算机使用代理(CUA)在现实专业工作流程中的新基准。该基准跨越六个领域,使用了23个软件即服务(SaaS)系统,包含106项需要长周期执行的任务,这些任务可以是纯文本或多模态的。初步实验显示,目前基于LLM的代理表现不佳,端到端完成的任务不到4%,这凸显了在规划、状态跟踪和跨应用程序上下文维护方面存在的重大局限性。
-
新基准显示AI代理难以处理真实的SaaS任务
研究人员推出了SaaS-Bench,这是一个新的基准,旨在评估计算机使用代理(CUAs)在软件即服务(SaaS)环境中的现实专业工作流程。该基准包含六个专业领域中23个SaaS系统的106个任务,需要长周期执行,并涵盖纯文本和多模态场景。初步实验显示,当前的LLM代理表现不佳,最好的模型端到端完成的任务不到4%,凸显了在规划、状态跟踪和错误恢复方面存在重大局限性。
-
调查梳理了自主使用计算机的智能体的安全和安保威胁
一篇新的调查论文对使用计算机的智能体(CUAs)构成的安全和安保威胁进行了分类。这些由LLM驱动的智能体可以自主地与软件和界面进行交互,带来了新的风险。该论文概述了这些威胁的分类法,并提出了防御策略,旨在指导未来安全CUAs的研究和实际部署。