Astra 语言模型在 ARC-AGI 基准测试中取得了令人印象深刻的分数,在 ARC-AGI-3 上达到 97%,在 ARC-AGI-1 上达到 86%。值得注意的是,这些高分是在未使用思维链(CoT)提示的情况下获得的,这表明该模型具有强大的内在推理能力。 AI
影响 展示了语言模型强大的推理能力,可能影响未来的基准测试开发和模型训练策略。
排序理由 语言模型的研究基准测试结果。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →