一项新基准表明,Astra 模型在推理能力方面取得了重大飞跃,特别是在无需思维链 (CoT) 的任务中。研究表明,与排名第二的模型 Fable 5.1 相比,Astra 在没有 CoT 的情况下解决推理问题的概率高出 8.6 倍。它还可以在单次前向传播中执行 7.2 个串行算术步骤,超越了 Gemini 3.8 Flash 和 Fable 5.1 等模型。 AI
影响 展示了大型语言模型在没有明确分步指导的情况下推理能力的重大进步,可能影响未来的模型开发。
排序理由 详细介绍新基准和模型性能的研究论文。
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →