🦅 大模型 · 6 分钟
Tokenizer 三模型并排对比
同一句话,GPT-4 / Claude /
Llama-3 三家切出来的 token 数和方式很不一样 ——
这直接决定 API 价格 和 上下文长度。
GPT-4 / tiktoken
cl100k_base · ~100k vocab
Claude (估算)
Anthropic SentencePiece
Llama-3 (估算)
128k vocab · BPE
每字符 token 比率
越低 = 越省 token = 越省钱。中文 / 日文上 GPT-4o 优势明显(用了更多多语种数据训 tokenizer)。
⚡ 关键观察
- 英文上三家差不多 —— 英文是所有 tokenizer 的"主语"。
- 中文 / 日文上差距明显 —— GPT-4 / Claude 用了更多多语种语料,每个中文字大多 1 token。Llama-3 早期版本中文偏弱(每字 ~2 token),新版改善。
- 代码上 GPT-4 略胜 —— OpenAI 训练数据里代码占比高,常用关键字(def / return / =>)都是 1 token。
- 表情/特殊字符是大坑 —— 一个 emoji 在某些 tokenizer 上要 3-5 token。
- 这只是估算 —— 真实切分要用各自官方库(tiktoken / anthropic / sentencepiece)。这里用近似规则便于直观感受。