Online-Mind2Web
PulseAugur coverage of Online-Mind2Web — every cluster mentioning Online-Mind2Web across labs, papers, and developer communities, ranked by signal.
-
BrowserForge 框架大规模生成网页代理训练数据
研究人员开发了 BrowserForge,一个旨在为训练网页代理生成大规模网页交互数据的框架。该系统利用数百个并行浏览器沙箱探索开放网络,创建了超过 200,000 条独特的交互轨迹。通过在此多样化数据集上训练多模态模型,该代理在 Online-Mind2Web 基准测试上的成功率从 25.66% 提高到 33.33%,证明了广泛的网站覆盖和并行数据合成的有效性。
-
Anthropic 发布 Claude Opus 4.8,增强了诚实度和速度
Anthropic 发布了 Claude Opus 4.8,这是其旗舰 AI 模型的更新版本,特别强调“诚实”和改进的校准。据报道,这一迭代产生静默代码缺陷的可能性降低了四倍,并提供了更明确的不确定性标记,这对于使用自主编码代理的开发人员来说是一个显著的进步。此次发布还包括更快、更便宜的“快速模式”,并在 SWE-Bench Pro 等基准测试中取得进展,表明 Anthropic 的前沿模型正在持续快速的开发周期中。
-
Microsoft Research 的 Webwright 提升了 AI Web Agent 的性能
Microsoft Research 开发了 Webwright,这是一个开源框架,允许 AI Agent 通过基于终端的方法与 Web 进行交互。与一次在一个浏览器中执行一步操作的传统 Agent 不同,Webwright Agent 在终端环境中编写和执行 Playwright 代码、bash 命令并检查日志。这种方法显著提高了性能,在 Odysseys 基准测试中取得了 60.1% 的成绩,远高于使用传统基于截图的 Agent …
-
Microsoft 发布 Fara1.5 代理,性能超越 OpenAI 和 Google
Microsoft Research 推出了 Fara1.5,这是一系列基于 Qwen3.5 构建的浏览器计算机使用代理模型(4B、9B 和 27B 参数)。这些代理通过解释屏幕截图并执行鼠标和键盘操作来与真实浏览器交互以完成任务。在 Online-Mind2Web 基准测试的评估中,最大的 Fara1.5 模型实现了 72% 的任务成功率,超越了 OpenAI 的 Operator 和 Google 的 Gemini 2.5 Com…