对 OpenAI 新推出的 GPT-6 Astra 模型的一项最新分析,突显了其基准分数可能存在的问题。尽管 OpenAI 在包括 ExploitBench 在内的多项测试中报告了近乎完美的结果,但作者指出,OpenAI 自己曾警告过在该特定基准测试中可能存在数据污染。此外,独立的汇总分数表明 Astra 的表现与其前代产品相当,这表明报告的头条数字可能难以解读。作者提出了一种替代的基准测试方法,使用 Commodore 64 来开发游戏,认为这种方法可以避免供应商资助的工具,并通过在受限、客观的环境中测试模型的通用能力来关注其整体能力。 AI
影响 引发了对 AI 模型基准测试可靠性的质疑,并提出了一种更客观的测试方法。
排序理由 文章批评了新模型发布的基准测试结果,并提出了一种替代的测试方法。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →