评估大型语言模型(LLM)的成本常常被忽视,这会产生一笔“影子账单”,超出直接推理成本。这种隐藏的开销源于证明可靠性所需的多次部署、对输出进行的大量裁判评估以及数据保留。有供应商报告称,一位数据主管表示,LLM作为裁判的评估成本是基线代理工作负载的十倍,但这只是一个轶事而非基准。τ-bench论文表明,要达到高可靠性,例如GPT-4o的8次通过成功率,需要进行大量部署,仅模拟和代理执行每项任务的成本就约为200美元。 AI
影响 强调了LLM评估相关的重大且通常未预算的成本,敦促从业者分解自己的账单,而不是依赖一般性估计。
排序理由 该条目讨论了LLM评估的成本影响,引用了供应商报告和研究论文来说明直接推理成本之外的隐藏开销。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →