OpenAI 发布了其最新的前沿模型 GPT-6 Astra,该模型在诸如长时推理和发现规则等特定任务能力方面取得了显著进步,而不是在通用智能方面有所提高。虽然其综合智能分数仅略高于其前代产品,并且落后于 Anthropic 的 Fable 5.1,但 Astra 在 ARC-AGI-3、FrontierMath、Terminal-Bench 和 ExploitBench 等基准测试中表现出色。尽管其单位价格高于 GPT-5.6 Sol,但其提高的代币效率可能导致某些应用(尤其是基于代理的任务)的总体成本降低。 AI
影响 在特定任务基准测试中设定了新的 SOTA,可能影响代理开发和企业采用。
排序理由 前沿实验室模型发布,附带系统卡。[lever_c 从 frontier_release 降级:ic=1 ai=1.0]
- Anthropic
- Claude Opus-5
- Fable 5.1
- Gemini 3.8 Flash
- GPT 5.6 "Sol"
- GPT-6 Astra
- Meta
- Muse Spark 1.3
- OpenAI
- X
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →