在宣布其新的 GPT-6 Astra 模型后,OpenAI 因更改其评估指标而受到审查。在一次不同寻常的发布延迟期间进行的更改,有时显示 Astra 的表现更好,而 Anthropic 的模型等竞争对手的表现似乎更差。OpenAI 表示,这些调整是为了确保模型性能的最准确表示,并承认基准测试结果可能存在固有的噪音。然而,差异和持续的修改引发了对 AI 模型基准测试的可靠性和潜在操纵的质疑。 AI
影响 引发了对 AI 模型基准测试完整性以及驱动指标操纵的竞争压力的担忧。
排序理由 关于主要 AI 实验室产品发布及其后续基准报告争议的重大新闻。
AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →