model · 2025/2/24 18:00:00
Claude 3.7 Sonnet 发布:首个集成推理模式的旗舰模型
Anthropic 推出 Claude 3.7 Sonnet 和 Claude Code CLI——用户可控制 thinking 时长,编码能力 SWE-bench 70.3% 大幅领先同档。
来源:Anthropic
查看原文 →
Anthropic 发布 Claude 3.7 Sonnet,第一个让用户控制”思考时长”的旗舰模型。
主要更新:
1. Extended Thinking 模式
- API 暴露一个
thinking_budget参数,0 token = 普通回答,更多 = 更深思考 - 同一个模型同时承担”普通对话”和”推理任务”,不需要切换
- 推理时模型显式生成思维链,用户可见
2. 编码能力
- SWE-bench Verified:70.3%(GPT-4.5: 38%,o1: 48%)
- TerminalBench:26%
- 真实软件工程任务上领先所有同档模型
3. Claude Code(CLI 工具)
- 终端原生 AI 编程 Agent
- 能跨多文件 refactor、跑测试、用 git
- 同期发布
定价:Sonnet 15/M output(与上代相同),thinking 模式不额外加价。
编辑批注:Anthropic 选择把推理能力做成”可调旋钮”而不是另一个模型——这种产品哲学很务实,避免了用户在 GPT-4 / o1 之间反复切换的痛苦。 编码 70% SWE-bench 是历史性数字。在它之前 SOTA 不到 50%。