PulseAugur
实时 22:50:05
English(EN) GPT-5.5 Scores 10.6% on ActiveVision, Humans Hit 96.1% [R]

GPT-5.5 和 Claude Fable 5 在新的 ActiveVision 基准测试中失败,得分远低于人类

一项名为 ActiveVision 的新基准测试旨在测试重复视觉感知能力,揭示了先进 AI 模型存在的显著局限性。GPT-5.5 的成功率仅为 10.6%,在 17 项任务中有 11 项完全失败。Claude Fable 5 的表现更差,得分为 3.5%,与人类参与者平均 96.1% 的准确率形成鲜明对比。研究强调,即使是顶级模型也难以完成需要持续视觉处理的任务,并且无法通过生成自己的代码来弥补。 AI

影响 凸显了当前 AI 在连续视觉感知任务中的局限性,表明需要超越当前推理和编码能力的全新架构。

排序理由 对现有前沿模型的新基准评估。[lever_c_从研究降级:ic=1 ai=1.0]

在 r/MachineLearning 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

GPT-5.5 和 Claude Fable 5 在新的 ActiveVision 基准测试中失败,得分远低于人类

报道来源 [1]

  1. r/MachineLearning TIER_1 English(EN) · /u/Justgototheeffinmoon ·

    GPT-5.5 Scores 10.6% on ActiveVision, Humans Hit 96.1% [R]

    <!-- SC_OFF --><div class="md"><p>The interesting finding from a new [arXiv paper](<a href="https://arxiv.org/abs/2607.16165">https://arxiv.org/abs/2607.16165</a>) isn't that a frontier vision model failed a new benchmark, that happens weekly, but the specific shape of the failur…