已发现 AWS Bedrock 的原始 API 和 LangChain 的集成之间存在 token 计数差异,这可能导致缓存提示的双重计费。带有 Anthropic messages 主体的原始 InvokeModel API 将输入 token 报告为未缓存的剩余部分,而 LangChain 的使用元数据包括完整的输入,并将缓存作为细分。这种差异可能导致定价函数对提示的缓存部分进行两次计费,从而抵消了提示缓存的成本节省优势。作者主张在定价计算中明确定义和要求 token 计数约定,以防止此类错误。 AI
影响 由于服务之间的 token 计数差异,使用提示缓存的 AI 应用程序可能面临成本增加。
排序理由 该项目讨论的是 AI 服务集成中的 token 计数技术问题,而不是新的模型发布或重大的行业事件。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →