PulseAugur
实时 12:51:40
English(EN) Your model benchmark measures everything except the bill

LLM基准测试忽略了关键的成本计算,作者解释

LLM的基准测试通常未能考虑到使用模型的实际成本,而是侧重于输出质量和token数量。作者提出了一个计算成本的简单公式:(输入token数 / 100万) * 输入价格 + (输出token数 / 100万) * 输出价格。这一点至关重要,因为一个每个token价格更低的模型,如果由于误解或重试而需要更多的token来完成任务,最终可能会更昂贵。文章建议记录每个任务的token使用量,根据个人任务为顶级模型候选者定价,并每季度重新计算成本,因为模型价格和功能都在不断发展。 AI

影响 强调了成本意识LLM选择的必要性,影响企业采用和开发策略。

排序理由 该条目是一篇评论文章,讨论了评估LLM成本的方法。

在 dev.to — LLM tag 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

LLM基准测试忽略了关键的成本计算,作者解释

报道来源 [1]

  1. dev.to — LLM tag TIER_1 English(EN) · Andrey Altrouter ·

    您的模型基准测试衡量了除账单外的一切

    <p>Every model benchmark I read ranks the same two things: how good the output was, and sometimes how many tokens it took. Almost none of them print the number you actually get charged for.</p> <p>That gap matters, because the two rankings are not the same list. A model can win o…