一项名为 ActiveVision 的新基准测试旨在测试重复视觉感知能力,揭示了先进 AI 模型存在的显著局限性。GPT-5.5 的成功率仅为 10.6%,在 17 项任务中有 11 项完全失败。Claude Fable 5 的表现更差,得分为 3.5%,与人类参与者平均 96.1% 的准确率形成鲜明对比。研究强调,即使是顶级模型也难以完成需要持续视觉处理的任务,并且无法通过生成自己的代码来弥补。 AI
影响 凸显了当前 AI 在连续视觉感知任务中的局限性,表明需要超越当前推理和编码能力的全新架构。
排序理由 对现有前沿模型的新基准评估。[lever_c_从研究降级:ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →