HelloAI ← 可视化画廊
🦅 大模型 · 6 分钟

Tokenizer 三模型并排对比

同一句话,GPT-4 / Claude / Llama-3 三家切出来的 token 数和方式很不一样 —— 这直接决定 API 价格上下文长度

字符数:31 · 字节数:31
GPT-4 / tiktoken
cl100k_base · ~100k vocab
tokens
推算 API 费用
Input:
Output:
Claude (估算)
Anthropic SentencePiece
tokens
Claude 3.5 Sonnet 费用
Input:
Output:
Llama-3 (估算)
128k vocab · BPE
tokens
自建推理费用(估)
Input:
Output:
每字符 token 比率
越低 = 越省 token = 越省钱。中文 / 日文上 GPT-4o 优势明显(用了更多多语种数据训 tokenizer)。

⚡ 关键观察

配套
L4-02 Tokenizer 与 BPE
底层算法详解
相关
Tokenizer Playground
单模型详细切分
相关
词表地图
GPT-4 词表里都有什么