最近的一项分析显示,在大多数大型语言模型中使用非英语语言会因Token化差异而产生更高的成本。例如,像Claude Opus 5这样的模型,将俄语文本的Token化速率几乎是英语的三倍,即使Token单价相同,也会导致非英语提示词的费用显著增加。这种差异源于Tokenizer在特定语言语料库上的训练方式,英语序列通常被分配单个Token,而其他语言则被分解成更多片段。 AI
影响 由于Token化偏差,非英语用户在使用当前大型语言模型时可能会面临更高的成本和更少的上下文窗口使用量。
排序理由 对大型语言模型非英语语言Token化成本的分析。
- Anthropic
- Claude
- Claude Opus 5
- DeepSeek V3
- DeepSeek V4
- Gemini 3.7 Flash
- GigaChat 3
- GLM-5.3
- GPT-4
- GPT-5.x
- GPT-6
- Grok 4.7
- Kimi k3
- OpenAI
- Qwen 3
- YandexGPT 5 Lite
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →