一位r/LocalLLaMA用户观察到Qwen 35B A3B和Gemma 26B A4B在tokenizing代码方面存在显著差异。Qwen将一段330行的HTML/JS代码片段处理成1609个token,而Gemma将相同的输入tokenized为4258个token。这种差异可能解释了Qwen在代码任务上的优势以及Gemma在语言处理方面的优势,因为Qwen似乎将代码视为一种不同的输入类型,而Gemma则像处理自然语言一样将其分解。用户还指出,对于一个较短的指令文档,tokenization计数几乎相同。 AI
影响 强调了tokenization策略如何影响模型在特定任务(如编码与自然语言处理)上的性能。
排序理由 用户观察和现有模型分析,并非新发布或研究论文。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →