PulseAugur
中
实时 21:30:58
实体 OSWorld

OSWorld

PulseAugur coverage of OSWorld — every cluster mentioning OSWorld across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
27
90 天内 27
发布 · 30天
0
90 天内 0
论文 · 30天
18
90 天内 18
层级分布 · 90 天
主题
关系
情绪 · 30 天

3 天有情绪数据

最近 · 第 1/2 页 · 共 28 条
  1. FRONTIER RELEASE · CL_286197 ·

    Anthropic 的 Claude Haiku 5.5 降低价格,但增加了 100K 标记的成本悬崖

    Anthropic 发布了 Claude Haiku 5.5,这是其经济高效语言模型的新版本。虽然提示词少于 100,000 个标记的基础价格已大幅降低,与 Haiku 4.5 相比可能高达 90%,但新的定价层和分词器意味着超过此阈值的提示词成本将增加五倍。这一变化,加上新的分词器(将文本计算为大约多 30% 的标记),需要仔细的提示词工程和监控来有效管理费用。该模型还引入了可调节的“努力”设置,影响思考时间和成本,并在 Termi…

  2. RESEARCH · CL_275438 ·

    AutoGUIWorld 框架合成 GUI 交互数据以供 AI 代理使用

    研究人员开发了 AutoGUIWorld,一个用于合成 GUI 交互轨迹以训练 AI 代理的新型框架。该系统利用图像生成器和规划器来创建真实的交互数据,而无需运行实际软件。生成的数据涵盖了各种操作系统和应用程序的 79,000 多个样本,已被证明可以显著提高 GUI 代理在现实世界任务中的性能。

  3. SIGNIFICANT · CL_269093 ·

    H Company 发布 Holo4 AI 代理模型,支持跨平台使用

    H Company 推出了 Holo4,这是一个专为 AI 代理设计的新型开源模型系列,能够与桌面、网页界面和 API 进行交互。该模型有两种尺寸:Holo4 27B 和 Holo4 35B-A3B,提供 256K 上下文窗口,旨在弥合仅限 GUI 的代理与依赖特定 API 的代理之间的差距。虽然 Holo4 35B-A3B 可根据 Apache 2.0 许可证用于商业用途,但 Holo4 27B 的权重仅限于非商业应用。

  4. TOOL · CL_239269 ·

    新的CUA-Universe环境训练AI代理执行混合GUI+CLI任务

    研究人员开发了CUA-Universe,一个旨在训练能够有效结合图形用户界面(GUI)和命令行界面(CLI)交互的计算机使用代理的新型环境。该系统解决了当前主要仅依赖GUI或CLI的代理所面临的局限性,这些代理导致任务完成效率低下。CUA-Universe从真实的桌面软件创建混合环境,使代理能够学习更高效的两种模式的协同工作。初步结果显示,在包括CUA-Verse、OSWorld和OSWorld-MCP在内的各种基准测试中,任务成功率…

  5. TOOL · CL_227156 ·

    新的CURA系统通过认证运行时警报检测AI代理故障

    一个名为CURA的新系统已被开发出来,用于实时监控计算机使用代理(CUAs)并检测故障。CURA通过分析遥测数据来运行,无需访问代理的内部工作机制,也不需要额外的LLM调用。在OSWorld任务的测试中,CURA成功识别了42.3%的故障,通常在任务终止前很长一段时间就发出警报,同时保持了较低的误报率。该系统旨在通过提供认证的运行时警报来加强监督,从而实现执行中的干预并可能恢复失败的任务。

  6. TOOL · CL_223092 ·

    新的ASIL接口增强了AI代理与软件的交互

    研究人员推出了一种名为ASIL(Agent-Software Interaction Layer)的新接口,旨在改进AI代理与软件应用程序的交互方式。ASIL用结构化的JSON观测和语义动作取代了低效的截图点击方法,实现了更强大、更高效的任务执行。该系统已在15个应用程序和380个任务的基准测试中得到验证,显示出显著的性能提升,尤其是在多应用程序场景下。ASIL还被证明对训练AI模型有效,小规模的监督微调和强化学习极大地提升了Qwen…

  7. TOOL · CL_210474 ·

    ChainWorld框架在复杂的、多步骤桌面任务上测试AI代理

    一篇新的研究论文介绍了ChainWorld,一个旨在评估AI代理在复杂、长时桌面任务上的框架。与之前专注于单一、原子操作的评估不同,ChainWorld将这些原子任务组合成多步骤工作负载。研究发现,当前的AI代理在处理这些扩展任务时遇到困难,即使任务按顺序呈现,完成率也低于31%。研究突出了单轮和多轮评估之间不同的失败模式,表明AI代理在精确性和会话管理方面存在挑战。

  8. SIGNIFICANT · CL_210098 ·

    Qwen3.8-27B开源模型凭借先进的智能体能力登顶排行榜

    阿里巴巴的Qwen团队已开源Qwen3.8-27B,这是一个拥有270亿参数的模型,在包括SWE Bench Pro和OSWorld在内的多个基准测试中取得了顶级排名。该模型在智能体能力方面展现出显著的进步,例如规划和多步任务完成,其表现优于更大的模型甚至云端旗舰模型。其架构融合了线性和全注意力层的创新组合,以高效处理长上下文,并为用户提供可控的“思考”模式。该模型的跨模态训练使其能够有效地在桌面、浏览器和移动设备等各种界面上运行。

  9. RESEARCH · CL_183113 ·

    AI代理:调试框架提供修复而非重新生成

    两篇研究论文提出了新颖的AI代理调试框架,将重点从重新生成转移到修复。第一个框架CUADebug通过分析视觉感知、空间定位和任务推理来针对计算机使用代理的故障,并使用CUADebugger等工具提高诊断准确性。第二篇论文为硬件加速器引入了一个特定领域的调试代理,认为调试接近失败的操作符比从头开始重新生成它们更有效,以显著更少的计算资源实现了更高的成功率。

  10. TOOL · CL_178822 ·

    中国 AI 代理 InAgent 在 OSWorld 基准测试中创下新纪录

    中国 AI 代理 InAgent 在 OSWorld 基准测试中取得了创纪录的 90.2% 成功率,成为首个突破 90% 门槛的代理。这一表现超越了 OpenAI、Google 和 Anthropic 等主要 AI 实验室此前的记录。该代理在系统级任务方面表现尤为强劲,在该类别中取得了 100% 的成功率,凸显了 AI 代理开发日益激烈的竞争。

  11. COMMENTARY · CL_172646 ·

    2026 LLM基准测试:没有赢家,专业化领导者涌现 · 跟踪1个来源

    对2026年20个领先LLM的全面基准测试显示,没有单一的占主导地位的模型,而是出现了跨不同任务的专业化领导者。Claude Opus 5在整体人工智能分析智能指数中领先,而特定模型在编码、代理工具使用、推理和价值方面表现出色。报告强调了成本效益日益增长的重要性,中国的开放权重模型以一小部分价格提供了具有竞争力的性能。它还提醒读者注意基准测试的素养,指出经典的评估已饱和,需要在一致的条件和工具使用下比较模型。

  12. TOOL · CL_169632 ·

    新的交互式奖励代理在GUI任务评估中达到86.9%的准确率

    研究人员开发了一种交互式奖励代理(IRA),旨在改进GUI代理的评估。该代理采用提议-验证框架,从环境状态中收集和确认证据,结合可见界面数据、系统配置和文件数据。IRA在新推出的GUI-RewardBench上达到了86.9%的准确率,该基准包含10个Ubuntu桌面应用程序类别的321个GUI任务轨迹。此外,当应用于GUI代理的强化学习时,IRA在OSWorld中促进了34.0%的成功率,证明了其在提供训练奖励信号方面的有效性。

  13. RESEARCH · CL_141903 ·

    AI代理在视觉任务中挣扎;EvoCUA-1.5在OSWorld基准测试中达到63.2%

    一项名为OSWorld的新基准测试显示,AI代理EvoCUA-1.5通过在模拟环境中进行试错学习,取得了63.2%的分数。另外,Apple Inc.开发的一项新的开放基准测试表明,即使是先进的AI模型在视觉工具任务上也面临困难,由于图像识别和解释方面的挑战,失败率超过50%。

  14. TOOL · CL_139589 ·

    新的BREW框架使LLM代理能够从经验中学习

    研究人员开发了BREW,这是一个新颖的框架,旨在使基于大型语言模型(LLM)的代理能够从过去的经验中学习。与每次会话都重新开始学习的当前代理不同,BREW将交互轨迹提炼成结构化的自然语言食谱知识库。该知识库捕获有关任务执行、适用性和潜在陷阱的基本信息。该系统利用扩展和收集蒙特卡洛树搜索算法来高效地构建和检索知识,并结合了事后重新标记,将不成功的尝试转化为学习机会。在OSWorld和tau^2-Bench等基准测试的评估中,与基线代理和…

  15. TOOL · CL_130314 ·

    AI代理基准测试现已包含成本数据,揭示巨大的价格差异

    创建了一个新的数据集来跟踪AI代理在各种基准测试上的性能成本,填补了现有排行榜主要关注分数的空白。该数据集连接了代理配置、基准任务、已验证的成功以及每次运行的记录成本。它揭示了显著的价格差异,对于在代理排行榜上看起来相似的系统,成本从0.03美元到超过1600美元不等。分析强调,对于具有廉价验证和重试能力的任务,低成本配置比仅基于分数的排名更具竞争力。

  16. RESEARCH · CL_128524 ·

    新的UI-MOPD方法支持跨平台GUI代理学习 · 已追踪3个来源

    研究人员开发了UI-MOPD,一种用于训练可在多个平台上运行的GUI代理的新颖方法。该方法解决了跨平台数据稀缺以及在适应新平台的同时保持现有平台性能的挑战。UI-MOPD利用多教师策略内蒸馏,动态选择特定平台的教师来转移知识并防止灾难性遗忘。在OSWorld和MobileWorld上的实验分别证明了该方法的有效性,任务成功率分别为38.2%和12.0%。

  17. TOOL · CL_119560 ·

    新的 GUIDE 框架使用视频检索减少 GUI 代理中的领域偏差

    研究人员开发了 GUIDE,一个旨在减轻 GUI 代理中领域偏差的新颖框架。这个即插即用的系统利用实时网络视频检索和自动注释管道,在不改变现有参数或架构的情况下,为代理提供特定领域的知识。GUIDE 的方法包括分析教程视频的字幕以识别相关内容,然后利用这些信息来增强代理对 UI 元素和任务规划的理解,从而提高实际性能。

  18. RESEARCH · CL_107758 ·

    新的强化学习框架使用视觉语言模型进行图形用户界面代理监督

    研究人员开发了一种新的计算机使用代理(CUA)强化学习框架,该框架利用自主视觉语言评估进行监督。通过使用视觉语言模型根据最终屏幕截图和指令判断任务完成情况,该方法解决了在开放式桌面环境中获取可扩展奖励信号的挑战。该框架将评估者的反馈建模为嘈杂的二元奖励通道,并使用经过噪声校正的奖励估计器进行近端策略优化,从而在各种模拟环境中成功率得到显著提高。

  19. COMMENTARY · CL_104609 ·

    AI代理在桌面任务上实现 66% 的成功率,但数据差距仍然是一个挑战

    计算机使用代理已取得显著进展,在 OSWorld 基准测试上的成功率在约一年内从 12% 跃升至 66%。微软的 Build 2026 主题演讲突显了这一快速进步,将 PC 定位为代理操作系统,并开源了 Microsoft Agent Framework。然而,剩余 34% 的失败率表明,这些代理在处理常见的桌面任务时仍然面临困难,这通常是由于接地性、效率低下以及缺乏明确的任务完成或错误检测信号。作者认为,这些失败主要是数据问题而非模…

  20. RESEARCH · CL_91414 ·

    新基准测试探究AI代理在欺骗性界面和不安全操作下的安全性

    两篇新的研究论文介绍了用于评估AI代理安全性的基准测试。OSGuard专注于计算机使用代理,区分安全和不安全的操作,并识别任务执行中的潜在危险。WebDecept针对网络代理,专门测试它们在电子商务场景中对欺骗性界面的易感性,发现当前代理存在漏洞,基于提示的约束通常不足。