一位用户演示了OpenAI的前沿语言模型GPT-5.6 Sol仅通过文本推理即可解决魔方。该模型在750秒内成功解开了魔方,没有依赖外部求解器或程序模拟器,这表明大型语言模型在空间推理和长时程状态跟踪方面取得了重大进展。这一成就挑战了此前显示领先大型语言模型在此类任务上通过率为0%的基准,凸显了AI能力的快速发展。 AI
影响 证明了大型语言模型现在可以处理复杂空间推理和长时程状态跟踪,可能影响需要此类能力的领域。
排序理由 前沿大型语言模型展示了特定能力(解决魔方),挑战了先前的基准。 [lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →