作者正在评估使用 Cerebras 硬件进行 LLM 推理的成本效益,特别是使用 GLM 4.7。虽然 Cerebras 提供了令人印象深刻的速度,但缺乏提示缓存导致与支持它的提供商相比成本显著更高,其中一个实例显示长对话的 token 成本存在 40 倍的差异。为了缓解这种情况,他们正在尝试一种拆分代理架构,在 Cerebras 上使用更便宜的 GPT OSS 120B 模型作为主代理,同时将屏幕生成子代理保留在 GLM 4.7 上,旨在在 Cerebras 实现提示缓存之前平衡速度和成本。 AI
影响 强调了提示缓存对于 LLM 推理成本效益的关键作用,并探讨了没有此功能的硬件的架构变通方法。
排序理由 文章讨论了 LLM 推理的基础设施和成本考虑,但它更多的是个人反思和评估,而不是产品发布或新研究。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →