一项名为 AndroidLife 的新基准测试了 AI 代理在智能手机上执行真实世界任务的能力,Qwen3.8-27B 模型取得了 56.7% 的成功率。测试在 OnePlus 手机上进行了 60 个连续任务,导致芯片最高温度达到 98.2°C,电池消耗 69%。虽然 Qwen3.8-27B 为文本模型设定了新基准,但它在多步应用交互和准确检索特定用户信息方面遇到了困难。 AI
影响 凸显了当前 AI 代理在移动设备上执行复杂、多步任务的局限性。
排序理由 该项目描述了一个用于评估 AI 代理在真实世界任务表现的新基准。 [lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →