新的人工智能模型 GPT Astra 在不使用工具的情况下,在 Mazebench 基准测试中取得了 13% 的分数。这一性能指标在 Reddit 的 r/singularity 子版块上分享,突显了该模型在复杂问题解决场景下的当前能力。 AI
影响 该基准分数表明了 GPT Astra 在复杂、无工具问题解决方面的当前性能局限性。
排序理由 该集群报告了一个特定命名人工智能模型的基准分数,属于研究范畴。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →