Perplexity AI 评估了 GPT-6 Astra,报告其在 WANDR 基准测试中的得分为 0.682,每项任务成本为 11.98 美元。这一性能代表了对其他测试模型的显著改进,比 Fable 5.1 的性能高出 13.5%,同时成本降低了 6.1%,并且比 Opus 5 的性能高出 27.0%,成本略高 3.3%。 AI
影响 为人工智能模型的性能和成本效益设定了新的基准,可能影响未来模型的开发和采用。
排序理由 该条目报告了在特定任务(WANDR)上对特定人工智能模型(GPT-6 Astra)的基准评估,并将其性能和成本与其他模型进行了比较。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →