PulseAugur
实时 06:51:49
实体 AndroidWorld

AndroidWorld

PulseAugur coverage of AndroidWorld — every cluster mentioning AndroidWorld across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
8
90 天内 17
发布 · 30天
0
90 天内 0
论文 · 30天
7
90 天内 15
层级分布 · 90 天
主题
情绪 · 30 天

6 天有情绪数据

最近 · 第 1/1 页 · 共 17 条
  1. TOOL · CL_239269 ·

    新的CUA-Universe环境训练AI代理执行混合GUI+CLI任务

    研究人员开发了CUA-Universe,一个旨在训练能够有效结合图形用户界面(GUI)和命令行界面(CLI)交互的计算机使用代理的新型环境。该系统解决了当前主要仅依赖GUI或CLI的代理所面临的局限性,这些代理导致任务完成效率低下。CUA-Universe从真实的桌面软件创建混合环境,使代理能够学习更高效的两种模式的协同工作。初步结果显示,在包括CUA-Verse、OSWorld和OSWorld-MCP在内的各种基准测试中,任务成功率…

  2. TOOL · CL_228956 ·

    新的 GUI-PRA 代理解决了长时程 GUI 自动化挑战

    研究人员开发了 GUI-PRA,这是一种旨在通过解决错误累积来改进长时程 GUI 自动化的新型代理。该代理利用经验注入标准合成来推导通用验证原则,并利用标准引导的自回归感知来使用多粒度视觉工具主动调查与任务相关的 UI 证据。GUI-PRA 在 AndroidWorld 和 Mobile-MiniWoB++ 等基准测试中,相比标准的进程奖励模型取得了显著改进,其中 Qwen3-VL 在 AndroidWorld 上达到了 54.74% 的成功率。

  3. TOOL · CL_227254 ·

    新的GMA基准测试揭示了当前移动AI助手的局限性

    一项名为GMA的新基准测试已被开发出来,用于评估通用移动AI助手在复杂真实场景中的表现。GMA包含七个应用程序和300个任务,涵盖四个难度级别,旨在比AndroidWorld和MobileWorld等现有基准测试捕捉到更多的多样性和复杂性。对八个前沿模型的评估显示,随着任务复杂性的增加,性能显著下降,表明当前的代理距离可靠满足用户需求还有很长的路要走。研究还强调,适当的工具设计,如上下文保留和显式状态跟踪,可以显著提高代理在要求苛刻的…

  4. TOOL · CL_215878 ·

    新的CRATE框架通过步级推理增强移动代理评估

    研究人员开发了CRATE,一个用于评估语言引导的移动代理的新两阶段框架。该框架使用视觉语言模型(VLM)作为裁判,以步级方式处理轨迹,以推理后果和状态变化,而不是一次性处理整个轨迹。CRATE关注任务完成和操作安全,并有一个名为CRATE-S的扩展,专门用于安全评估。实验表明,CRATE在任务完成基准测试中取得了高精度,优于现有方法,而CRATE-S在安全基准测试中表现出高度一致性。

  5. SIGNIFICANT · CL_210098 ·

    Qwen3.8-27B开源模型凭借先进的智能体能力登顶排行榜

    阿里巴巴的Qwen团队已开源Qwen3.8-27B,这是一个拥有270亿参数的模型,在包括SWE Bench Pro和OSWorld在内的多个基准测试中取得了顶级排名。该模型在智能体能力方面展现出显著的进步,例如规划和多步任务完成,其表现优于更大的模型甚至云端旗舰模型。其架构融合了线性和全注意力层的创新组合,以高效处理长上下文,并为用户提供可控的“思考”模式。该模型的跨模态训练使其能够有效地在桌面、浏览器和移动设备等各种界面上运行。

  6. TOOL · CL_193275 ·

    新框架AndroidReality解决了移动智能体鲁棒性差距问题

    研究人员推出AndroidReality,一个旨在评估和增强移动智能体鲁棒性的框架。该框架通过将界面可变性分为状态、转换和动作扰动,来解决智能体在真实世界条件下性能下降的问题。通过在AndroidWorld之上构建一个扰动基准,AndroidReality揭示了显著的鲁棒性差距和常见的错误类型,从而开发了一种名为测试时内省恢复(TTIR)的无训练机制来缓解这些故障。

  7. RESEARCH · CL_187228 ·

    新方法提升移动GUI代理性能并降低成本 · 跟踪3个来源

    研究人员开发了三种新方法来提高移动GUI代理的性能,这些代理是旨在与移动应用程序交互的AI系统。StepReflect专注于GUI状态转换的结构化预测,在AndroidWorld上实现了比GPT-5.2更高的准确率,并降低了API成本。AppDeltaWorld将GUI转换建模为代码更新,而不是无约束的图像或文本,提高了保真度并实现了更好的训练环境。门控事后知识蒸馏(GHD)在训练期间使用下一个屏幕截图作为特权信息,以帮助代理学习正确…

  8. TOOL · CL_191651 ·

    StepReflect 为移动代理提供高效的GUI反思

    研究人员开发了StepReflect,一种提高自主移动GUI代理准确性的新方法。与使用昂贵开放式推理的现有方法不同,StepReflect将GUI反思视为一项监督结构化预测任务。该方法通过分阶段管道进行训练,在AndroidWorld上实现了82.16%的转换级别准确率,显著优于GPT-5.2。StepReflect还在多种代理配置下展示了改进或相当的任务成功率,并降低了与GPT反思相比的API成本。

  9. TOOL · CL_195676 ·

    新的门控滞后蒸馏增强了GUI代理的训练

    研究人员开发了一种名为门控滞后蒸馏(GHD)的新训练技术,以提高GUI代理的性能。GHD在训练期间利用未来的截图作为特权信息,使代理即使在即时反馈不足的情况下也能学习正确的推理。该方法解决了标准模仿学习中的一个关键限制,即动作的关键原理仅在后续状态中才显而易见。在与视觉语言模型一起测试时,GHD在AndroidWorld和AndroidLab等基准数据集上展示了改进的任务成功率。

  10. RESEARCH · CL_165246 ·

    新框架增强LLM代理控制和不确定性监控 · 跟踪3个来源

    研究人员正在开发新的方法来实时控制和监控大型语言模型(LLM)代理的行为。一种名为ARDena的方法,通过结构化提示使用场景驱动的控制来修改代理行为,而无需更改底层模型,并在多模态具身代理中显示出有效性。另一种方法,Multi-Head Latent Control,直接从LLM的潜在生成过程中推断控制信号,从而实现模型之间的有效路由并改进工具使用等任务的决策。此外,还提出了一个使用贝叶斯网络的框架,通过将token级别的对数概率转换…

  11. RESEARCH · CL_105021 ·

    新的训练方法提高了AI代理在智能手机上的性能

    研究人员开发了PhoneBuddy,这是一种新颖的训练方法和模型系列,旨在增强开放AI模型与智能手机交互的能力。该方法结合了真实手机环境和名为PhoneWorld的模拟应用内环境,PhoneWorld是从真实的GUI使用数据构建的。训练过程包括监督微调和强化学习,混合方法在真实手机和AndroidWorld基准测试中的任务成功率方面显示出最显著的改进。

  12. RESEARCH · CL_107698 ·

    新方法通过更好的上下文和无标注学习增强移动GUI智能体 · 跟踪2个来源

    两篇新研究论文介绍了改进移动GUI智能体能力的创新方法。MemGUI-Agent专注于主动上下文管理,通过将上下文维护视为一等操作来处理长时序任务,在应用切换过程中保留关键信息。而MobileForge则通过整合真实应用交互和分层反馈引导策略优化,实现了这些智能体的无标注适应,减少了对人工监督的需求。

  13. TOOL · CL_86782 ·

    新型防御系统保护移动 GUI 代理隐私

    研究人员开发了 CAPED,这是一种新颖的防御机制,旨在保护用户在使用移动 GUI 代理时的隐私。这些代理通过截图操作应用程序,可能会无意中暴露与用户任务无关的敏感个人信息。CAPED 作为一种手机端层,仅选择性地暴露代理完成任务所需的必要内容,同时屏蔽附带的私人数据。评估表明,CAPED 在保持高任务效用的同时,显著减少了截图中的附带泄露,表明了设备-云交互在 GUI 代理方面更安全的方法。

  14. RESEARCH · CL_77162 ·

    StainFlow通过新颖的奖励模型改进GUI智能体训练

    研究人员引入了StainFlow,这是一种新颖的过程奖励模型,旨在增强GUI智能体的训练。该方法通过提供更精细的训练信号来解决强化学习中反馈稀疏的问题。StainFlow利用实体污点追踪来客观地分离任务阶段,并动态链接局部证据以提高关键节点验证的准确性。

  15. SIGNIFICANT · CL_66950 ·

    Hcompany 发布 Holo3.1 代理,实现快速本地化计算机使用

    Hcompany 发布了 Holo3.1,这是一个新的计算机使用代理系列,旨在跨各种环境和代理框架提供强大的性能。此次发布强调本地推理能力,提供 FP8、Q4 GGUF 和 NVFP4 等量化检查点,以便在终端用户设备上部署。Holo3.1 在移动自动化和跨平台性能方面显示出显著的改进,旨在提供私密高效运行的通用计算机使用代理。

  16. RESEARCH · CL_48788 ·

    新框架和基准测试推动移动 GUI 代理能力发展

    研究人员开发了几个新的框架和基准测试,以推进移动 GUI 代理的能力。STAMP 为虚拟环境中的代理引入了显式内存训练,提高了任务的韧性。PhoneWorld 提供了一个可扩展的管道,用于将真实的移动轨迹转换为可控环境,用于训练和评估。MIRAGE 强调了 VLM 驱动的代理中的一个漏洞,展示了如何通过用户生成的内容实现提示注入。MobileExplorer 专注于通过并行探索 UI 元素和使用上下文提示来加速这些代理的设备上推理。M…

  17. TOOL · CL_28329 ·

    基于代码和文本训练的新世界模型指导移动GUI代理

    研究人员开发了一种新颖的方法,通过在四种模态上训练世界模型来增强移动GUI代理:增量文本、完整文本、基于扩散的图像和可渲染代码。这些模型在相关基准测试中取得了最先进的性能,证明了不同表示形式在预测行动后果方面的效用。研究发现,虽然可渲染代码为数据构建提供了高保真度,但基于文本的反馈对于在线执行更为稳健,并且生成的轨迹可以改善代理性能,尽管存在分布变化。