一个名为“人类第六感”的新基准被推出,用于评估直观视觉推理,涵盖空间、因果和社会理解。该基准揭示了人类和 AI 模型之间存在显著的性能差距,人类得分 93.1%。领先的 AI 模型 GPT-6-astra 得分为 53.6%,而中位数模型的表现则显著低于 30.9%。这凸显了在开发能够媲美人类直观推理能力的 AI 系统方面所面临的持续挑战。 AI
影响 凸显了 AI 直观推理能力与人类相比存在显著差距,指明了未来研究和发展的方向。
排序理由 该集群引入了一个新的 AI 评估基准。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →