API 价格($ per 1M tokens,2026 量级)
⚠️ 价格会变,必查官方文档。下表是 2026 年中典型量级。
旗舰前沿
| 模型 | Input | Output | 备注 |
|---|---|---|---|
| Claude Opus 4.x | $15 | $75 | 顶级写作 / 复杂 Agent |
| GPT-5 | $10 | $40 | OpenAI 旗舰 |
| Gemini 2.5 Pro | $3.5 | $10.5 | 1M context 性价比之王 |
主力(性价比最佳)
| 模型 | Input | Output | 备注 |
|---|---|---|---|
| Claude Sonnet 4.6 | $3 | $15 | 编码 / Agent 首选 |
| GPT-5 mini | $0.5 | $2 | 日常任务首选 |
| Gemini 2.5 Flash | $0.3 | $2.5 | 大批量任务 |
推理模型(贵但好)
| 模型 | Input | Output | 备注 |
|---|---|---|---|
| OpenAI o3 | $10 | $40 | ARC-AGI 突破 |
| OpenAI o4-mini | $1.1 | $4.4 | 性价比推理 |
| DeepSeek R1 | $0.55 | $2.2 | 开源推理之王 |
开源 / 低价
| 模型 | Input | Output | 备注 |
|---|---|---|---|
| DeepSeek V3 | $0.27 | $1.1 | 极致性价比 |
| Qwen 2.5 Max | $1.6 | $6.4 | 阿里旗舰 |
| Llama 3.1 405B(Together) | $3 | $3 | 最大开源 |
| Llama 3.1 70B(Groq) | $0.59 | $0.79 | 极速推理 |
📐 月度预算公式
月度成本 = 月活用户 × 每用户日均请求 × 30
× (平均 input tokens × input 单价
+ 平均 output tokens × output 单价) 例 1:客服 chatbot(DeepSeek V3)
1000 月活 × 5 请求/天 × 30 天
× (3000 input × $0.27/1M + 500 output × $1.1/1M)
= 150,000 请求/月
× ($0.00081 + $0.00055)
≈ $204 / 月 例 2:同样负载用 Claude Opus
150,000 × (3000 × $15/1M + 500 × $75/1M)
= 150,000 × ($0.045 + $0.0375)
≈ $12,375 / 月
差距:60× 💡 省钱 6 招
1. Prompt Caching
系统提示稳定时缓存,命中后费用降 90%。Anthropic / OpenAI / Google 都支持。
2. 模型分层路由
简单问题 → 便宜 mini 模型;复杂问题 → 升级旗舰。80% 流量便宜,20% 上贵,整体省 5-10×。
3. 批量 API(Batch API)
非实时任务用 Batch API,价格通常打 5 折(OpenAI / Anthropic / Gemini 都有)。
4. 缩短 Output
Output 单价通常是 Input 的 3-5×。让 LLM "简洁回答 / 不解释" 能砍掉 30-50% 费用。
5. 上下文剪枝
RAG 召回别全塞——top-3 通常比 top-10 准确率差不多但 input 少 70%。
6. 结构化输出 / Schema 约束
明确 JSON Schema 比"请输出 JSON"省 token 且少错。
🚨 常见烧钱误区
- 循环里调 LLM 不加 max_tokens 限制——一次 bug 烧上千刀
- Agent 没设置 max_iterations——死循环烧 token
- 所有请求都用 Opus / GPT-5——90% 的请求 mini 完全够
- 没接告警——账单超阈值要发通知(每个云控制台都能配)
- RAG 把整个文档当 chunk——每次请求拉几万 token
📊 决策:用哪家
| 需求 | 推荐 |
|---|---|
| 极低成本批量任务 | DeepSeek V3 / Qwen |
| 1M context 长文档 | Gemini 2.5 Pro/Flash |
| Agent / 编程 | Claude Sonnet 4.6 |
| 多步推理 | DeepSeek R1 / o4-mini |
| 极速响应(<100ms) | Groq (Llama / DeepSeek) |
| 数据敏感 | Azure OpenAI / Vertex / 私有部署 |
下一步
- 深入成本优化 → L4-12: LLM 成本优化
- 选模型策略 → 选 LLM 决策树
- Prompt Caching 实战 → L4-15: Prompt Caching