arXiv上发表的一项新研究揭示了通过API衡量的AI模型性能与其在聊天机器人界面中的实际性能之间存在显著差异。研究人员发现,与界面对应物相比,API评估倾向于在准确性和一致性方面给模型打出更高的分数。例如,ChatGPT通过API和界面访问的性能差距大于两个不同模型代GPT 5.3和GPT 5.4之间的差异。这种“上下文有效性差距”表明,API基准分数可能无法可靠地预测模型在实际部署系统中的表现,从而使评估和购买决策复杂化。 AI
影响 挑战了基于API的基准测试的可靠性,可能影响AI模型性能的评估和比较方式。
排序理由 在arXiv上发表的研究论文,详细介绍了AI模型性能评估的发现。
在 Hugging Face Daily Papers 阅读 →
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →