PulseAugur
实时 21:39:14
English(EN) Our CI eval gate sent us a token bill. The deterministic one sent nothing.

LLM-as-judge CI门禁产生意外成本;确定性替代方案提供节省

一位工程师发现,使用LLM-as-judge指标进行CI/CD评估门禁会产生显著的持续成本。这些评估拉取请求的门禁,由于需要对OpenAI等模型进行重复的API调用,可能会产生巨额账单。该工程师发现,像Promptfoo、MLflow和Future AGI这样的确定性评估框架,可以在不进行模型调用的情况下执行类似的门禁功能,因此每个拉取请求的成本为零。这种方法避免了对外部API定价、延迟和速率限制的依赖,为CI/CD质量门禁提供了更具成本效益和可靠的解决方案。 AI

影响 强调了将LLM-as-judge指标集成到CI/CD中的隐藏成本,提倡使用确定性替代方案以节省成本和提高可靠性。

排序理由 该项目讨论了在CI/CD管道中使用LLM-as-judge指标的成本影响和替代方案,重点关注开发人员的实际实施和成本节约策略。

在 dev.to — LLM tag 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

LLM-as-judge CI门禁产生意外成本;确定性替代方案提供节省

报道来源 [1]

  1. dev.to — LLM tag TIER_1 English(EN) · Ethan Walker ·

    Our CI eval gate sent us a token bill. The deterministic one sent nothing.

    <p>TL;DR. A quality gate that grades every pull request with an LLM-as-judge metric is buying a judge call per PR, per metric, forever. At forty PRs a day and a dozen judge-graded metrics, that is real money and, worse, a merge queue now coupled to a paid API's price, latency, an…