PulseAugur
实时 18:25:34
English(EN) I measured what 14 MCP servers cost a context window. Claude counts them 64% higher than tiktoken

研究发现,Claude的tokenizer计算模式字节数比tiktoken高64%

一位独立研究人员最近进行的一项测量研究揭示了不同的LLM tokenizer(特别是Claude和tiktoken)在计算相同模式数据token时存在显著差异。研究发现,Claude的tokenizer计算的模式字节数比广泛使用的离线免费tokenizer tiktoken高约64%。当使用Claude处理依赖于模式序列化的工具时,这种差异可能导致对上下文窗口使用量的严重高估,从而影响成本计算和实际上下文窗口大小。研究还强调了工具暴露和客户端优化(如Claude Code中的渐进式披露)的差异,这些差异可以极大地减少最终用户的实际token负载。 AI

影响 突出了Claude用户在成本和上下文窗口计算方面可能出现的错误,强调了准确测量tokenizer的必要性。

排序理由 独立的LLM tokenizer对比测量研究。[lever_c_demoted from research: ic=1 ai=1.0]

在 dev.to — MCP tag 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

研究发现,Claude的tokenizer计算模式字节数比tiktoken高64%

报道来源 [1]

  1. dev.to — MCP tag TIER_1 English(EN) · Roshan Singh ·

    I measured what 14 MCP servers cost a context window. Claude counts them 64% higher than tiktoken

    <p>Last month I <a href="https://dev.to/lopster568/what-should-an-mcp-tool-return-i-ran-72-trials-instead-of-arguing-43b4">ran 72 trials</a> to settle what an MCP tool should return, because a maintainer would not take opinion for an answer. That left the other half open: before …