Ox Alpha 在一项包含 113 个任务的综合基准测试中的表现已降至 63%,远低于其在较小子集上 80% 的分数。这种差异引发了对其模型真实能力与最初说法相比的担忧。人工智能模型之间低廉的切换成本也使公司能够通过将常规任务交给更便宜的系统,并将高级模型用于复杂推理来优化支出。 AI
影响 人工智能模型的性能差异凸显了仔细评估的必要性,并可能影响企业人工智能基础设施的预算。
排序理由 该集群讨论了人工智能模型的基准性能,属于研究范畴。
在 Mastodon — fosstodon.org 阅读 →
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →