OSWorld 2.0
PulseAugur coverage of OSWorld 2.0 — every cluster mentioning OSWorld 2.0 across labs, papers, and developer communities, ranked by signal.
-
Qwen-CUA 代理通过截图实现原生计算机使用
研究人员推出 Qwen-CUA,这是一种新的人工智能代理,专为原生计算机交互而设计,能够仅使用截图和标准输入设备来操作软件。该代理利用了一个拥有 3970 亿参数的 Qwen 混合专家模型,并通过跟踪多达 20 张活动截图来保持上下文。Qwen-CUA 在大规模云集群和海量任务数据上进行开发,在基准测试中表现强劲,超越了其前身 Qwen3.7,并可与专有系统相媲美。一个更大的版本 Qwen-CUA-Max 进一步提高了这些分数,并显著…
-
Anthropic 发布 Claude Opus 5,以一半价格匹配 Fable 5 性能 · 已追踪 4 个来源
Anthropic 发布了 Claude Opus 5,这是一款新的 AI 模型,定位为比其顶级 Fable 5 模型更实惠的替代品。在许多编码基准测试中,Opus 5 的性能与 Fable 5 相当,尤其是在代码库级别任务和通用计算机工作中,但价格却只有一半。该模型还具有 100 万个 token 的上下文窗口,并显著减少了安全分类器的干预,使其更适合自主编码代理。与 Opus 5 一同发布的还有 Claude Code v2.1.…
-
LabPlot 和 OSWorld 2.0 被强调为比挣扎中的 AI 代理更重要的工具
像 LabPlot 这样的专业工具对于提供精确的、特定领域的成果至关重要,尤其与目前在复杂、长周期任务上表现不佳的 AI 代理相比。即使是像 Claude Opus 4.8 这样先进的模型也存在局限性,在特定指标上仅达到中等准确率,并且在状态维护、细节跟踪和动态适应方面遇到困难。这凸显了在科学研究和数据分析中对可靠的、开源解决方案的持续需求。
-
Anthropic 的 Claude Opus 5 占据顶级 AI 基准榜首,价格下调 · 跟踪 1 个来源
Anthropic 发布了 Claude Opus 5,一款新的旗舰级 AI 模型,在人工智能分析智能指数(Artificial Analysis Intelligence Index)和 Agentic Index 等独立基准测试中取得了顶级排名。该模型在包括 Agentic 终端编码和新颖推理在内的各种任务上,显著优于其前身 Claude Opus 4.8 以及 Claude Fable 5 和 GPT-5.6 Sol 等竞争对手…
-
Anthropic 的 Claude Opus 5 性能大幅提升且成本降低 · 跟踪 8 个来源
Anthropic 发布了 Claude Opus 5,这是一款新的前沿模型,与前代 Opus 4.8 相比,在成本降低的同时提供了显著的性能提升。虽然 Anthropic 的官方基准测试突出了大幅提升(通常以比率形式呈现),但详细分析显示,在 SWE-bench Pro 编码基准测试上提高了 10 个点,并在内部生命科学任务上有了显著改进。该模型的定价旨在颠覆市场,以一半的成本提供接近 Fable 5 的能力,引发了关于迁移策略以及…
-
Anthropic 的 Claude Opus 5 以一半的价格匹配 Fable 5 的性能 · 跟踪了 10 个来源
Anthropic 发布了 Claude Opus 5,一款新模型,其性能可与 Fable 5 相媲美,而价格却只有 Fable 5 的一半。早期评估和用户轶事表明,Opus 5 在编码、复杂推理和智能体任务方面表现出色,在 Frontier-Bench 和 CursorBench 等基准测试中,其能力常常能与 Fable 5 相匹配甚至超越。该模型还拥有 100 万个 token 的上下文窗口和更高的效率,使其成为开发人员和企业应用的有力选择。
-
Anthropic 发布 Claude Opus 5,在基准测试中挑战 Fable 5
Anthropic 推出了 Claude Opus 5,这是一款新的前沿模型,以更低的成本提供了接近 Claude Fable 5 的性能。早期评估显示,Opus 5 在编码和知识工作中表现出色,在 Frontier-Bench 和 ARC-AGI 等任务上设定了新的最先进基准。虽然它在 3D 模型重建和复杂编码任务等领域展现了强大的能力,但其在网络安全利用方面的表现仍落后于 Mythos 5 等模型。用户报告的体验褒贬不一,一些人称…