一项新的基准测试显示,AI 模型 Astra 可以在其潜在空间中连续执行 34 次简单数学运算,而无需依赖思维链提示。这比其他模型有了显著的改进,Sol 只能处理 8 次运算,而 Claude Opus 4.6 可以达到 12 次。这项旨在测试长推理链的基准测试显示,直到 Astra 发布之前进展甚微,这表明大型语言模型处理序列计算的方式可能取得了进展。 AI
影响 该基准测试表明,大型语言模型在处理序列计算(尤其是在没有明确提示的情况下)方面的推理能力可能取得了巨大飞跃。
排序理由 该条目详细介绍了一个 AI 模型的新基准测试结果,这是一个研究里程碑。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →