Computer Use Agents
PulseAugur coverage of Computer Use Agents — every cluster mentioning Computer Use Agents across labs, papers, and developer communities, ranked by signal.
7 天有情绪数据
-
Together 和 yutori_ai 联合举办 CUA Night 活动,讨论计算机使用代理
Together 和 yutori_ai 将于本周四联合举办一场名为 CUA Night 的活动。该活动将聚焦计算机使用代理,涵盖研究、模型、数据、RL 环境和推理等主题。
-
AI代理优先考虑明确合同和工作流程而非演示
计算机使用代理的开发正在迅速推进,重点正从视觉吸引人的演示转向实际实施。该领域的成功可能取决于将关键操作转化为明确定义的合同、建立范围授权以及创建为代理执行而优化的工作流程的能力。这种方法强调健壮的、基于合同的系统,而不是肤浅的用户界面。
-
新的“PRAC”攻击针对AI代理的视觉模态
研究人员开发了一种名为PRAC的新攻击,该攻击针对多模态基础模型的视觉模态,特别是计算机使用代理(CUAs)。与之前直接操纵模型输出的攻击不同,PRAC使用隐蔽的对抗性补丁来重定向模型的注意力。该方法已被证明成功地操纵了在线购物平台上的CUA选择特定目标产品。虽然该攻击需要白盒访问权限才能创建,但它对微调模型表现出泛化能力,对基于开放权重模型构建的CUA构成了重大的安全风险。
-
新基准测试 AI 代理在多步提示注入攻击下的安全性
研究人员推出 StepJack,这是一个旨在测试计算机使用代理 (CUA) 在多步间接提示注入攻击下的安全性新基准。这些攻击涉及将对抗性指令分布在一系列网页中,使其单独看起来无害。在包含 480 个测试示例的 StepJack 基准测试中进行的评估显示,多步攻击将包括 GPT-5.4 Mini 在内的几款最先进的 CUA 的成功率显著提高了 31.2 个百分点。
-
新AI代理'heuse+'学会控制鼠标和键盘
一款名为heuse+的新型AI代理正在开发中,旨在通过控制计算机的鼠标和键盘来实现任务自动化。该代理是AI发展的一个更广泛趋势的一部分,该趋势专注于创建能够与数字环境交互的更自主的系统。
-
新型“隐形墨水威胁”暴露AI代理的安全风险
研究人员发现了一类针对计算机使用代理(CUAs)的新型安全威胁。CUAs是设计用于操作系统和网络的AI系统。“隐形墨水威胁”涉及低危害的注入目标,这些目标难以与合法任务区分开来,从而绕过了诸如人工干预确认等标准防御措施。一个新的基准测试II-Bench已被开发出来,包含跨三个平台的444个对抗性示例,用于测试这些威胁,揭示了当前CUAs存在的重大安全风险。
-
新研究论文详细介绍了人工智能代理用户体验的设计空间
一篇新研究论文探讨了计算机使用代理的用户体验(UX),这些代理是生成式人工智能系统,旨在根据命令自动执行用户界面内的操作。该研究确定了代理用户体验的设计空间,将21个不同的考虑因素进行了分类,并概述了原型化这些体验所需的工具。研究人员开发了AgentUXlab,这是一个允许开发人员为网站构建和测试不同代理用户体验方法的工具。
-
新的强化学习框架使用视觉语言模型进行图形用户界面代理监督
研究人员开发了一种新的计算机使用代理(CUA)强化学习框架,该框架利用自主视觉语言评估进行监督。通过使用视觉语言模型根据最终屏幕截图和指令判断任务完成情况,该方法解决了在开放式桌面环境中获取可扩展奖励信号的挑战。该框架将评估者的反馈建模为嘈杂的二元奖励通道,并使用经过噪声校正的奖励估计器进行近端策略优化,从而在各种模拟环境中成功率得到显著提高。
-
Anthropic 的 Claude 3.5 Sonnet 速度大幅提升;WeaveBench 揭示了代理的局限性
Anthropic 发布了 Claude 3.5 Sonnet,一款新 AI 模型,其速度是前代 Claude 3 Opus 的两倍,同时保持或提高了性能。这一进步对于需要快速响应和高吞吐量的应用具有重要意义。与此同时,一个名为 WeaveBench 的新基准测试被引入,用于评估旨在与计算机交互的 AI 代理。初步测试表明,当前前沿模型在 WeaveBench 上的通过率仅为 41.2%,凸显了开发能够有效导航图形和命令行界面以完成复…
-
新的HiViG批评者通过历史和视觉提升AI代理的GUI性能
研究人员开发了HiViG,一个旨在提高计算机使用代理(CUAs)在复杂图形用户界面环境中性能的新颖框架。HiViG通过结合过去行动的历史感知和视觉基础来检测错误,从而解决了现有批评者的局限性。这个多模态批评者在真实的GUI轨迹上进行训练,通过总结过去的成就并根据屏幕截图验证执行坐标来评估行动,从而在有缺陷的行动发生之前阻止它们。
-
新研究解决计算机使用代理的安全性和效率问题 · 跟踪 6 个来源
近期研究正在探索计算机使用代理(CUAs)的安全性和效率。一篇论文介绍了 MisActBench 和一个名为 DeAction 的护栏,用于检测和纠正不当行为,显著降低了攻击成功率。另一项研究比较了 GUI 和 CLI 代理,发现虽然 GUI 代理最初表现更好,但经过技能增强的 CLI 代理可以实现更高的成功率。第三篇论文强调了隐私风险,介绍了 AgentCIBench 来评估 CUA 如何处理上下文完整性,并发现许多代理会在应用程序…
-
新框架旨在提高 AI 对用户意图的理解能力
两篇新研究论文介绍了一个用于理解和控制 AI 交互中用户意图的计算框架。第一篇《意图信号理论》将用户潜在意图与实际提示区分开来,并提出私有意图常常在翻译过程中丢失。第二篇《IntentScore》提出了一个面向计划的奖励模型,用于评估和改进 AI 代理在图形用户界面中执行的操作质量,并在任务成功率方面取得了显著的改进。一篇相关文章讨论了 AI 代理意图识别和路由的实际应用,强调了关键词匹配的局限性以及使用 LLM 进行更鲁棒的意图分类的优势。
-
新基准CUActSpot针对AI智能体的复杂交互
研究人员推出了CUActSpot,这是一个新的基准测试,旨在评估计算机使用智能体(CUAs)在多模态复杂且不频繁交互方面的能力。该基准测试解决了GUI操作中的长尾问题,即少数复杂交互导致大多数任务失败,并假设这是由于数据稀缺造成的。他们提出的数据合成流程生成场景、记录交互,并使用LLM创建指令和动作轨迹,从而使他们的Phi-Ground-Any-4B模型优于更大的开源模型。