OSWorld-Verified
PulseAugur coverage of OSWorld-Verified — every cluster mentioning OSWorld-Verified across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
新的 EFR 框架提高了桌面 GUI 代理的准确性
研究人员推出了一种名为证据优先反思(EFR)的新型框架,旨在提高桌面 GUI 代理的性能。EFR 通过将动作诱导的视觉差异提取与结果验证分离开来,解决了复杂界面中细微视觉变化带来的挑战。该方法使用标记集(Set-of-Marks)注释来识别和过滤相关变化,从而做出更可靠的决策。实验表明,EFR 在 OSWorld-Verified 和 WindowsAgentArena 等基准测试中提高了反思器的准确性和任务成功率。
-
UI-Mate 通过新的训练和演示方法推进开放权重 GUI 代理
研究人员推出了 UI-Mate,这是一种开放权重的基础 GUI 代理,旨在增强复杂数字任务的自动化。该代理利用环境基础训练堆栈和上下文演示学习来提高可靠性并克服数据稀缺和提示模糊等限制。UI-Mate 在通用计算机使用基准测试中取得了新的最先进成果,并在 OSWorkerBench 基准测试的任务成功率和进展方面取得了显著改进,优于其基础模型。
-
阿里巴巴的Qwen3.8-Max模型在基准测试中超越GPT-5.6和Claude Fable 5
阿里巴巴的Qwen团队发布了Qwen3.8-Max,这是一个拥有2.4万亿参数的多模态模型,据称在OSWorld-Verified基准测试中表现优于GPT-5.6 Sol Max和Anthropic的Fable 5。该模型声称能够自主完成复杂的软件项目并复现研究论文。阿里巴巴已宣布了具有竞争力的API定价,并计划下周发布开放权重,但许可条款仍未披露。
-
Qwen-CUA 代理通过截图实现原生计算机使用
研究人员推出 Qwen-CUA,这是一种新的人工智能代理,专为原生计算机交互而设计,能够仅使用截图和标准输入设备来操作软件。该代理利用了一个拥有 3970 亿参数的 Qwen 混合专家模型,并通过跟踪多达 20 张活动截图来保持上下文。Qwen-CUA 在大规模云集群和海量任务数据上进行开发,在基准测试中表现强劲,超越了其前身 Qwen3.7,并可与专有系统相媲美。一个更大的版本 Qwen-CUA-Max 进一步提高了这些分数,并显著…
-
阿里云发布Qwen3.8,提升编程和办公AI能力 · 追踪2个来源
阿里云正式发布了其新的旗舰大型语言模型Qwen3.8,总参数量达到2.4万亿。该先进模型在编程和专业办公任务方面表现出显著的改进,跻身全球顶级大型模型之列。支持视觉理解和100万token上下文长度的Qwen3.8-Max,以及Qwen3.8-27B模型,将于下周开源发布。新模型提供了增强的推理能力、更快的推理速度以及具有竞争力的API服务定价。
-
Google 发布更便宜的 Gemini Flash 模型,优先考虑成本而非巅峰性能
Google 发布了三款新的 Gemini Flash 模型——3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber——专注于大规模 AI 代理的成本效益。与早期版本相比,3.6 Flash 模型减少了输出 token 消耗并降低了价格,在各种基准测试中表现有所提高。虽然这些模型优先考虑效率和成本降低,但 Google 承认其旗舰 Gemini 3.5 Pro 仍处于合作伙伴测试阶段,而 Gemini …
-
Google 扩展 Gemini,推出更便宜的模型并扩大代理访问范围
Google 扩展了其 Gemini AI 产品,发布了三款新模型,其中包括专为编码和代理任务设计的 Gemini 3.6 Flash。该公司还将其个人 AI 代理 Gemini Spark 提供给 AI Pro 计划的更广泛订阅用户。这些举措旨在平衡模型能力与经济效益和更广泛的分发,特别是对于能够跨各种应用程序管理用户工作流的 AI 代理。
-
Anthropic 发布 Claude Sonnet 5,增强代理能力
Anthropic 发布了 Claude Sonnet 5,这是其更新的中端模型,在代理能力和性能方面显著优于其前身 Sonnet 4.6。新模型在规划、浏览器和终端导航以及自主任务执行方面展现出增强的能力,使其更适合复杂的多步操作。虽然 Sonnet 5 提供了强大的成本效益比,尤其是在较低的努力水平下,但 Anthropic 建议将旗舰 Opus 4.8 模型保留用于高度准确性关键的任务。