HelloAI
📄 论文精读 🏆 必读经典 · 2025 · Anthropic · 2025-05 ~ 2026

Claude 4 / Sonnet 4 系列:编码 + Agent 双核心

Anthropic
📖 如果你只读一段,读这段
Anthropic 2025-05 起陆续发布 Claude 4 / Sonnet 4.x 系列。Claude Code(基于 Sonnet 4)从 2025-05 GA 到 2026-02 做到 $2.5B ARR——是 Anthropic 增长最快的产品线。"扩展思考 + 长 Agent 工作流"两个能力定义了 2025-2026 LLM 的工程方向。
#Claude 4#Anthropic#Coding#Agent#必读#经典

为什么这是分水岭

Claude 4 / Sonnet 4 系列是 Anthropic 把 Claude 从”通用 chatbot” 转变为**“代码 + Agent 双核心产品”**的关键代际。

意义:

  • Claude Code 6 个月 → 1BARR9个月1B ARR、9 个月 → 2.5B ARR
  • 工程师社区把 Sonnet 4 当默认编码模型
  • 推动 Cursor / Cline / Continue 等所有 AI IDE 后端切到 Sonnet
  • “Long-horizon Agent” 成为可工程化的能力

关键模型版本

版本发布定位
Sonnet 3.72025-02第一个引入”Extended Thinking” 推理模式
Sonnet 42025-05Claude Code GA 的核心模型
Opus 4 / 4.x2025-Q3顶级旗舰,复杂研究 / 长流程
Sonnet 4.52025-Q4编码能力进一步打磨
Sonnet 4.62026-Q1当前主力(截至 2026-06)

Anthropic 不发”完整技术报告 PDF”——而是分散在 blog / system card / model card 里。

三个核心能力跃升

1. Extended Thinking(扩展思考)

类似 OpenAI o1,但实现细节不同:

response = client.messages.create(
    model="claude-sonnet-4",
    thinking={"type": "enabled", "budget_tokens": 5000},
    messages=[...]
)

特点:

  • 用户可控:手动设 thinking budget(vs OpenAI 自动决定)
  • 可见:API 返回 thinking 内容(vs OpenAI o1 默认隐藏)
  • 混合:同一对话可在不同 turn 选择是否启用 thinking

意义:

  • 工程师可针对复杂任务精细控制思考深度
  • 调 budget 是新的”成本 / 质量”权衡维度

2. Long-horizon Agentic Coding

Claude Sonnet 4 在 SWE-bench Verified 上跳升:

  • Claude 3.5 Sonnet:~50%
  • Claude 4 Sonnet:~72% (2025-Q2)
  • Claude 4.6 Sonnet:~80% (2026-Q1)

Note: SWE-bench 不是唯一指标,真实生产复杂度更高。

但关键能力:

  • 30+ step Agent 流程仍能保持连贯
  • 工具使用稳定性(少卡死、少忘 / 重复)
  • 自我修正:写测试 → 跑失败 → 改代码 → 再跑

这是 Claude Code 能 work 的底层基础—— 模型不是写一段代码,是参与一个开发流程

3. Computer Use 集成

Claude 4 起,Computer Use 成为内置能力(不再是 beta):

  • 截图理解准确率提升
  • 操作步数减少(更聪明的 plan)
  • OSWorld 得分从 22% → ~50%+

这让 Claude 系列在 GUI agent 赛道继续领先。

工程化亮点

1. Prompt Caching 全面成熟

Claude 4 时期 prompt caching 从 beta 转 GA:

  • 缓存读取:原价的 10%(90% off)
  • TTL 5 分钟(ephemeral)或 1 小时(可买)
  • 最多 4 个 cache breakpoint

这让长 system prompt(KB-MB 级)在重度使用下不再昂贵。

2. Tool Use 稳定性

Anthropic 2025 数据:Sonnet 4 在 100-step Agent 任务中保持工具调用正确率 > 95%。 对比 Sonnet 3.5:~85%。 看似不大,但100 步 × 0.95 vs × 0.85 = 60× 完成率差距(指数衰减)。

3. 超长上下文

  • Claude 3.5 Sonnet:200K
  • Claude 4 Opus:200K(同)
  • Claude 4 Sonnet 6 Pro:1M+(针对 Claude Code 长仓库场景)

Anthropic 没有走 Gemini 的 10M 路线—— 而是把 200K-1M 区间的实际可用质量做扎实。 “haystack” 之外的复杂检索任务 Claude 系列长期领先。

4. Constitutional AI 升级

Anthropic 持续迭代 CAI:

  • 更细的”原则集”
  • “宪法学习”(meta-learning constitutional principles)
  • 减少”过度拒绝”——以前 Claude 容易拒绝合理请求

商业意义

时间Claude Code ARR
2025-05 (GA)$0 (启动)
2025-11$1B annualized
2026-02$2.5B annualized

人类工程师圈的口碑迁移

  • 2023 默认推荐 Copilot
  • 2024 默认推荐 Cursor + GPT-4
  • 2025-2026 默认推荐 Cursor / Claude Code + Sonnet 4.x

这个迁移背后是 Sonnet 4 在编码上的真实质量优势

它的局限

1. 多模态没领跑

和 GPT-5o / Gemini 比,Claude 4 的图像 / 视频理解仍弱一档。 Anthropic 战略上似乎也不押多模态主线。

2. 价格不便宜

Sonnet 4.6 input 3/output3 / output 15 per M tokens—— 比 DeepSeek V3 贵 10×、比 Gemini Flash 贵 10×。 靠”质量溢价”,但价格压力持续。

3. 生态封闭性

Claude Code 工具栈强绑定 Anthropic API—— 不像 Cursor 那样多模型路由。

4. 没有公开”技术报告 PDF”

Anthropic 把所有信息分散—— 研究者无法像看 Llama 3 那样系统理解 Claude 4 训练细节。 透明度低于 Meta / DeepSeek。

推荐配套阅读

💡 一句话总结

Claude 4 不是一个”模型”,是一条”产品线”—— Anthropic 把”Sonnet 当编码 / Agent 主力 + Opus 当研究旗舰” 双轨打磨了 18 个月。

它证明了:对齐 + 工程 + 速度 + 客户洞察 一起做,能从 OpenAI 手里抢走前沿市场。

2026 上半年,Claude 4 系列是编码 / Agent 工程的事实标准—— 但多模态 / 极致便宜 这两个维度仍由 Gemini / DeepSeek 引领。 LLM 生态从”一家独大”彻底进入”多极并存”。

📬

想要更多论文精读

订阅每周精选 —— 下一篇论文笔记直接送邮箱。

💬

讨论区

· 用 GitHub 账号登录评论
⚠️ Giscus 评论未配置 —— 在 src/components/Comments.astro 顶部填入 仓库 ID 和分类 ID(见组件注释里的配置步骤)。