AppAgent
PulseAugur coverage of AppAgent — every cluster mentioning AppAgent across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
Android AI Agent易受多种漏洞攻击
研究人员在五个开源Android AI Agent框架中发现了重大的安全漏洞,包括AppAgent、AppAgentX、Mobile-Agent-v3、Open-AutoGLM和MobA。这些框架旨在与移动设备交互并可能在主机PC上运行代码,但被发现容易受到各种攻击,其中大多数至少会受到七种已演示的漏洞中的六种的攻击。这些漏洞源于允许不可见屏幕文本控制AI Agent、在连接的PC上执行命令以及不安全地处理数据和权限等问题。
-
Android AI代理易受截图操纵攻击 · 跟踪到1个来源
研究人员发现,有七次实验室攻击针对五个开源Android AI代理框架,包括AppAgent和Open-AutoGLM。这些攻击利用了人类和机器对截图感知上的差异,代理可能会将隐藏的文本或图像元素解读为指令,从而导致意外操作。这些漏洞分为两类:屏幕感知(Screen Perception),操纵代理如何看待屏幕;以及误用通道(Misused Channel),干扰执行流程。虽然目前这些只是实验室演示,尚未确认有现实世界的利用,但使用这…
-
AnovaX:本地语音助手使用 Gemini LLM 进行桌面控制
研究人员开发了 AnovaX,这是一款新颖的本地优先语音助手,旨在完全在用户的计算机上运行,并将桌面作为其主要交互界面。与依赖云的助手不同,AnovaX 在本地处理音频,并利用由 Gemini LLM 规划器编排的多代理系统。该系统将计划转化为专门的代理,用于应用程序控制、键入和网页浏览等任务,并包含用于故障的自适应恢复机制和用于嵌套委托的递归 MetaAgent。配套的 Flask 服务器允许通过智能手机进行远程控制和实时监控。
-
AppAgent: LLM代理像人类一样学会使用智能手机应用
研究人员开发了AppAgent,一个新颖的框架,使基于大型语言模型的模态代理能够操作智能手机应用程序。该代理模仿人类的点击和滑动等交互方式,无需直接访问系统后端。AppAgent通过自主探索或观察人类演示来学习导航和使用新应用,并为复杂的跨应用任务构建知识库。在10个应用程序和50个任务上的广泛测试证明了其处理各种高级操作的能力。