🏷️ 标签
#推理模型
共找到 10 条相关内容: 10 条资讯
📰 资讯
2025/1/20 2025/1/31 2025/2/17 2025/2/24 2025/3/25 2025/4/16 2025/5/22 2025/8/7 2025/11/18 2026/5/21
DeepSeek R1 开源发布:推理能力对标 OpenAI o1,训练成本仅 $5.6M
DeepSeek 发布 R1,在 AIME 数学竞赛、Codeforces 等推理基准上达到 o1 级水平。模型 + 权重 + 训练方法全部开源(MIT 协议),训练成本仅 $5.6M。
OpenAI 发布 o3-mini:推理模型平民化,免费 ChatGPT 用户也能用
OpenAI 在 DeepSeek R1 发布后 10 天紧急推出 o3-mini,性价比大幅提升。低 / 中 / 高三档“推理强度”任选,编码、数学、科学专业领域全面提升。
xAI 发布 Grok 3:10× 训练算力,引入 Think 模式 + DeepSearch
Musk 旗下 xAI 发布 Grok 3,用 20 万张 H100 集群 Colossus 训练(10× Grok-2)。引入推理 Think 模式 + 联网搜索 DeepSearch,AIME / GPQA 上号称超 GPT-4o。
Claude 3.7 Sonnet 发布:首个集成推理模式的旗舰模型
Anthropic 推出 Claude 3.7 Sonnet 和 Claude Code CLI——用户可控制 thinking 时长,编码能力 SWE-bench 70.3% 大幅领先同档。
Gemini 2.5 Pro 发布:Google 首个「思考型」模型登顶 LMArena
Google 推出 Gemini 2.5 Pro Experimental——一个会先思考再回答的推理模型,发布即登顶 LMArena,100 万 token 上下文(200 万即将到来)。
OpenAI 发布 o3 + o4-mini:推理模型首次原生使用所有工具
OpenAI 在 4 月 16 日发布 o3 和 o4-mini。第一次让推理模型 agentically 调用 ChatGPT 全部工具——搜索、Python、图像生成、视觉分析。ARC-AGI 上比 o1 准确率高 3 倍。
Anthropic 发布 Claude 4:Opus 4 与 Sonnet 4,SWE-bench 双双破 72%
Anthropic 推出 Claude Opus 4 与 Claude Sonnet 4,混合即时/扩展思考;SWE-bench Verified 上 Opus 4 达 72.5%、Sonnet 4 达 72.7%。
OpenAI 发布 GPT-5:统一系统 + 自动路由,成为 ChatGPT 新默认
OpenAI 推出 GPT-5——一个集成快速回答与 GPT-5 Thinking 的统一系统,成为所有 ChatGPT 用户的默认模型;AIME 2025 无工具 94.6%、SWE-bench Verified 74.9%。
Google 发布 Gemini 3 Pro:LMArena 1501 Elo 登顶
Google 推出 Gemini 3 Pro,以 1501 Elo 登顶 LMArena;GPQA Diamond 91.9%、SWE-bench Verified 76.2%,100 万 token 上下文,并首发 Deep Think 模式。
阿里发布 Qwen3.7-Max:主打「Agent 基座」的旗舰模型
阿里云发布 Qwen3.7-Max,定位通用 Agent 基座;GPQA Diamond 92.4、Terminal-Bench 2.0 69.7,并演示 35 小时、上千次工具调用的自主运行。