据报道,一款新的人工智能模型 GPT-6 Astra 在 ARC-AGI-3 基准测试中取得了 98.6% 的分数,显著超过了之前 GPT-5.6 "Sol" 模型的 7.8%。尽管取得了如此高的性能,OpenAI 警告不要直接比较,因为评估方法存在差异。虽然 GPT-6 Astra 展现了先进的问题解决能力,并为数学研究提供了帮助,但其推理一致性被认为不稳定,并且实现 AGI 的状态仍未得到确认。 AI
影响 为 AI 推理能力设定了新的基准,可能影响未来的模型开发和 AGI 研究。
排序理由 该项目报告了 AI 模型的新基准分数,属于研究范畴。[lever_c_demoted from research: ic=1 ai=1.0]
在 Mastodon — mastodon.social 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →