HelloAI
model · 2025/2/24 18:00:00

Claude 3.7 Sonnet 发布:首个集成推理模式的旗舰模型

Anthropic 推出 Claude 3.7 Sonnet 和 Claude Code CLI——用户可控制 thinking 时长,编码能力 SWE-bench 70.3% 大幅领先同档。

来源:Anthropic 查看原文 →

Anthropic 发布 Claude 3.7 Sonnet,第一个让用户控制”思考时长”的旗舰模型

主要更新:

1. Extended Thinking 模式

  • API 暴露一个 thinking_budget 参数,0 token = 普通回答,更多 = 更深思考
  • 同一个模型同时承担”普通对话”和”推理任务”,不需要切换
  • 推理时模型显式生成思维链,用户可见

2. 编码能力

  • SWE-bench Verified:70.3%(GPT-4.5: 38%,o1: 48%)
  • TerminalBench:26%
  • 真实软件工程任务上领先所有同档模型

3. Claude Code(CLI 工具)

  • 终端原生 AI 编程 Agent
  • 能跨多文件 refactor、跑测试、用 git
  • 同期发布

定价:Sonnet 3/Minput3/M input、15/M output(与上代相同),thinking 模式不额外加价。

编辑批注:Anthropic 选择把推理能力做成”可调旋钮”而不是另一个模型——这种产品哲学很务实,避免了用户在 GPT-4 / o1 之间反复切换的痛苦。 编码 70% SWE-bench 是历史性数字。在它之前 SOTA 不到 50%。

Claude 3.7 Sonnet 公告 · Claude Code GitHub