GPT-6 Astra 的新基准已发布,该模型正接受人工智能通用智能 (AGI) 的高级测试评估。其中一项由 Demis Hassabis 提出的基准测试,涉及在 1911 年前的知识上训练模型,并评估其独立发展相对论的能力,类似于爱因斯坦的成就。该测试旨在区分真正的智能和创造力与单纯的知识检索和综合,支持者认为人工智能在科学发展上将比人类历史拥有显著优势。 AI
影响 根据理论通用人工智能基准评估高级人工智能能力,可能为人工智能智能设定新标准。
排序理由 该集群讨论了模型的基准和评估标准,与研究相关。
AI 生成摘要 · Google Gemini · 来自 6 个来源。 我们如何撰写摘要 →