Anthropic 的 Claude Opus 5 使用一个名为 TWIST 的新基准测试成功解决了复杂的魔方谜题。该基准测试要求 AI 解释魔方的截图并发出指令,模拟真实场景,而无需直接访问魔方的状态。Claude Opus 5 在 44 分钟内完成了 20 步打乱,使用了 73 张截图和约 240,000 个 token,大部分时间花在“思考”上,而不是魔方操作。 AI
影响 展示了 LLM 在视觉推理和解决复杂问题方面的先进能力,可能对机器人技术和复杂任务自动化产生影响。
排序理由 该条目描述了一个新的基准测试和模型在该测试上的表现,属于研究范畴。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →