一个名为 Corteza 的开源工具,由 Troy 开发,在 ARC-AGI-3 基准测试中取得了 98.6% 的分数。这一成就的实现是使用了 Claude Opus 5,并完成了 25 个公开游戏中的全部 183 个关卡。Corteza 套件旨在在一个持久的 R 工作空间中编写和重用函数,允许数据和函数在对话压缩过程中持续存在。 AI
影响 展示了 LLM 在复杂基准测试中的高级推理能力,可能影响未来 AI 的发展。
排序理由 使用 LLM 进行的研究基准测试结果。[lever_c_demoted from research: ic=1 ai=1.0]
在 Mastodon — mastodon.social 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →