Claude 4 / Sonnet 4 系列:编码 + Agent 双核心
为什么这是分水岭
Claude 4 / Sonnet 4 系列是 Anthropic 把 Claude 从”通用 chatbot” 转变为**“代码 + Agent 双核心产品”**的关键代际。
意义:
- Claude Code 6 个月 → 2.5B ARR
- 工程师社区把 Sonnet 4 当默认编码模型
- 推动 Cursor / Cline / Continue 等所有 AI IDE 后端切到 Sonnet
- “Long-horizon Agent” 成为可工程化的能力
关键模型版本
| 版本 | 发布 | 定位 |
|---|---|---|
| Sonnet 3.7 | 2025-02 | 第一个引入”Extended Thinking” 推理模式 |
| Sonnet 4 | 2025-05 | Claude Code GA 的核心模型 |
| Opus 4 / 4.x | 2025-Q3 | 顶级旗舰,复杂研究 / 长流程 |
| Sonnet 4.5 | 2025-Q4 | 编码能力进一步打磨 |
| Sonnet 4.6 | 2026-Q1 | 当前主力(截至 2026-06) |
Anthropic 不发”完整技术报告 PDF”——而是分散在 blog / system card / model card 里。
三个核心能力跃升
1. Extended Thinking(扩展思考)
类似 OpenAI o1,但实现细节不同:
response = client.messages.create(
model="claude-sonnet-4",
thinking={"type": "enabled", "budget_tokens": 5000},
messages=[...]
)
特点:
- 用户可控:手动设 thinking budget(vs OpenAI 自动决定)
- 可见:API 返回 thinking 内容(vs OpenAI o1 默认隐藏)
- 混合:同一对话可在不同 turn 选择是否启用 thinking
意义:
- 工程师可针对复杂任务精细控制思考深度
- 调 budget 是新的”成本 / 质量”权衡维度
2. Long-horizon Agentic Coding
Claude Sonnet 4 在 SWE-bench Verified 上跳升:
- Claude 3.5 Sonnet:~50%
- Claude 4 Sonnet:~72% (2025-Q2)
- Claude 4.6 Sonnet:~80% (2026-Q1)
Note: SWE-bench 不是唯一指标,真实生产复杂度更高。
但关键能力:
- 30+ step Agent 流程仍能保持连贯
- 工具使用稳定性(少卡死、少忘 / 重复)
- 自我修正:写测试 → 跑失败 → 改代码 → 再跑
这是 Claude Code 能 work 的底层基础—— 模型不是写一段代码,是参与一个开发流程。
3. Computer Use 集成
Claude 4 起,Computer Use 成为内置能力(不再是 beta):
- 截图理解准确率提升
- 操作步数减少(更聪明的 plan)
- OSWorld 得分从 22% → ~50%+
这让 Claude 系列在 GUI agent 赛道继续领先。
工程化亮点
1. Prompt Caching 全面成熟
Claude 4 时期 prompt caching 从 beta 转 GA:
- 缓存读取:原价的 10%(90% off)
- TTL 5 分钟(ephemeral)或 1 小时(可买)
- 最多 4 个 cache breakpoint
这让长 system prompt(KB-MB 级)在重度使用下不再昂贵。
2. Tool Use 稳定性
Anthropic 2025 数据:Sonnet 4 在 100-step Agent 任务中保持工具调用正确率 > 95%。 对比 Sonnet 3.5:~85%。 看似不大,但100 步 × 0.95 vs × 0.85 = 60× 完成率差距(指数衰减)。
3. 超长上下文
- Claude 3.5 Sonnet:200K
- Claude 4 Opus:200K(同)
- Claude 4 Sonnet 6 Pro:1M+(针对 Claude Code 长仓库场景)
Anthropic 没有走 Gemini 的 10M 路线—— 而是把 200K-1M 区间的实际可用质量做扎实。 “haystack” 之外的复杂检索任务 Claude 系列长期领先。
4. Constitutional AI 升级
Anthropic 持续迭代 CAI:
- 更细的”原则集”
- “宪法学习”(meta-learning constitutional principles)
- 减少”过度拒绝”——以前 Claude 容易拒绝合理请求
商业意义
| 时间 | Claude Code ARR |
|---|---|
| 2025-05 (GA) | $0 (启动) |
| 2025-11 | $1B annualized |
| 2026-02 | $2.5B annualized |
人类工程师圈的口碑迁移:
- 2023 默认推荐 Copilot
- 2024 默认推荐 Cursor + GPT-4
- 2025-2026 默认推荐 Cursor / Claude Code + Sonnet 4.x
这个迁移背后是 Sonnet 4 在编码上的真实质量优势。
它的局限
1. 多模态没领跑
和 GPT-5o / Gemini 比,Claude 4 的图像 / 视频理解仍弱一档。 Anthropic 战略上似乎也不押多模态主线。
2. 价格不便宜
Sonnet 4.6 input 15 per M tokens—— 比 DeepSeek V3 贵 10×、比 Gemini Flash 贵 10×。 靠”质量溢价”,但价格压力持续。
3. 生态封闭性
Claude Code 工具栈强绑定 Anthropic API—— 不像 Cursor 那样多模型路由。
4. 没有公开”技术报告 PDF”
Anthropic 把所有信息分散—— 研究者无法像看 Llama 3 那样系统理解 Claude 4 训练细节。 透明度低于 Meta / DeepSeek。
推荐配套阅读
- HelloAI L4-04 Agent 构建详解
- HelloAI L4-15 Prompt Caching 工程实战
- HelloAI L4-08 LLM 评估
- HelloAI 案例研究:Anthropic
- 论文:Constitutional AI(基础方法)
- Claude 4 Sonnet 模型卡
Claude 4 不是一个”模型”,是一条”产品线”—— Anthropic 把”Sonnet 当编码 / Agent 主力 + Opus 当研究旗舰” 双轨打磨了 18 个月。
它证明了:对齐 + 工程 + 速度 + 客户洞察 一起做,能从 OpenAI 手里抢走前沿市场。
2026 上半年,Claude 4 系列是编码 / Agent 工程的事实标准—— 但多模态 / 极致便宜 这两个维度仍由 Gemini / DeepSeek 引领。 LLM 生态从”一家独大”彻底进入”多极并存”。
想要更多论文精读
订阅每周精选 —— 下一篇论文笔记直接送邮箱。
讨论区
· 用 GitHub 账号登录评论src/components/Comments.astro 顶部填入
仓库 ID 和分类 ID(见组件注释里的配置步骤)。