HelloAI
速查表

💰 LLM 成本对照表

主流 LLM API 价格大致对照 + 月度预算公式 + 省钱 6 招。 价格变动快,必须以官网为准,本表是量级参考。

API 价格($ per 1M tokens,2026 量级)

⚠️ 价格会变,必查官方文档。下表是 2026 年中典型量级。

旗舰前沿

模型InputOutput备注
Claude Opus 4.x$15$75顶级写作 / 复杂 Agent
GPT-5$10$40OpenAI 旗舰
Gemini 2.5 Pro$3.5$10.51M context 性价比之王

主力(性价比最佳)

模型InputOutput备注
Claude Sonnet 4.6$3$15编码 / Agent 首选
GPT-5 mini$0.5$2日常任务首选
Gemini 2.5 Flash$0.3$2.5大批量任务

推理模型(贵但好)

模型InputOutput备注
OpenAI o3$10$40ARC-AGI 突破
OpenAI o4-mini$1.1$4.4性价比推理
DeepSeek R1$0.55$2.2开源推理之王

开源 / 低价

模型InputOutput备注
DeepSeek V3$0.27$1.1极致性价比
Qwen 2.5 Max$1.6$6.4阿里旗舰
Llama 3.1 405B(Together)$3$3最大开源
Llama 3.1 70B(Groq)$0.59$0.79极速推理

📐 月度预算公式

月度成本 = 月活用户 × 每用户日均请求 × 30
        × (平均 input tokens × input 单价
          + 平均 output tokens × output 单价)

例 1:客服 chatbot(DeepSeek V3)

1000 月活 × 5 请求/天 × 30 天
× (3000 input × $0.27/1M + 500 output × $1.1/1M)
= 150,000 请求/月
× ($0.00081 + $0.00055)
≈ $204 / 月

例 2:同样负载用 Claude Opus

150,000 × (3000 × $15/1M + 500 × $75/1M)
= 150,000 × ($0.045 + $0.0375)
≈ $12,375 / 月

差距:60×

💡 省钱 6 招

1. Prompt Caching

系统提示稳定时缓存,命中后费用降 90%。Anthropic / OpenAI / Google 都支持。

2. 模型分层路由

简单问题 → 便宜 mini 模型;复杂问题 → 升级旗舰。80% 流量便宜,20% 上贵,整体省 5-10×。

3. 批量 API(Batch API)

非实时任务用 Batch API,价格通常打 5 折(OpenAI / Anthropic / Gemini 都有)。

4. 缩短 Output

Output 单价通常是 Input 的 3-5×。让 LLM "简洁回答 / 不解释" 能砍掉 30-50% 费用。

5. 上下文剪枝

RAG 召回别全塞——top-3 通常比 top-10 准确率差不多但 input 少 70%。

6. 结构化输出 / Schema 约束

明确 JSON Schema 比"请输出 JSON"省 token 且少错。

🚨 常见烧钱误区

  • 循环里调 LLM 不加 max_tokens 限制——一次 bug 烧上千刀
  • Agent 没设置 max_iterations——死循环烧 token
  • 所有请求都用 Opus / GPT-5——90% 的请求 mini 完全够
  • 没接告警——账单超阈值要发通知(每个云控制台都能配)
  • RAG 把整个文档当 chunk——每次请求拉几万 token

📊 决策:用哪家

需求推荐
极低成本批量任务DeepSeek V3 / Qwen
1M context 长文档Gemini 2.5 Pro/Flash
Agent / 编程Claude Sonnet 4.6
多步推理DeepSeek R1 / o4-mini
极速响应(<100ms)Groq (Llama / DeepSeek)
数据敏感Azure OpenAI / Vertex / 私有部署

下一步