不读这条新闻,你就掉队了
每日自动抓取 · AI 摘要 · 人工精选
Anthropic 完成 650 亿美元 H 轮融资,估值跃至 9650 亿
Anthropic 在 5 月 28 日同步官宣 H 轮融资:650 亿美元 post-money 估值 9650 亿,run-rate 收入已过 470 亿。这是史上规模最大的私募融资之一,距离 2 月 G 轮(3800 亿)仅 3.5 个月。
Anthropic 发布 Claude Opus 4.8:浏览器智能体能力大幅提升
Anthropic 推出 Claude Opus 4.8,在 Online-Mind2Web 浏览器智能体任务上达 84%,定价维持 5/25 美元每百万 token。
Devin 母公司 Cognition 融资超 10 亿美元,估值 260 亿
据 TechCrunch 报道,AI 编程公司 Cognition(Devin)融资超 10 亿美元,投后估值 260 亿美元,由 Lux Capital、General Catalyst、8VC 领投;年化营收约 4.92 亿美元。
Anthropic「Glasswing」项目:一个月内发现逾万个高危漏洞
Anthropic 公布 Project Glasswing 首月进展:用 AI 辅助安全测试,在关键软件中发现逾 1 万个高/严重级漏洞,约 50 家机构参与(Cloudflare、Mozilla、微软等)。
阿里发布 Qwen3.7-Max:主打「Agent 基座」的旗舰模型
阿里云发布 Qwen3.7-Max,定位通用 Agent 基座;GPQA Diamond 92.4、Terminal-Bench 2.0 69.7,并演示 35 小时、上千次工具调用的自主运行。
OpenAI 推进内容溯源:C2PA 合规 + SynthID 水印 + 公开验证工具
OpenAI 成为 C2PA 合规生成式产品,并引入 Google DeepMind 的 SynthID 隐形水印,同时推出公开验证工具预览版,帮助判断图片是否由 OpenAI 生成。
Google 发布 Gemini 3.5 Flash:旗舰级智能,Flash 级速度
Google 推出 Gemini 3.5 Flash,主打智能体与编码,号称比其它前沿模型快 4 倍;Terminal-Bench 2.1 达 76.2%,3.5 Pro 下月跟进。
Anthropic 收购 Stainless:补强 Agent 的「连接力」
Anthropic 收购 SDK / MCP 工具公司 Stainless——它生成了 Anthropic 历来每一个官方 SDK;此举意在强化 Claude 连接数据与工具的能力。
DeepSeek 发布 V4 预览版:1M 上下文成默认,开源权重上线
DeepSeek 推出 V4 预览版,包含 V4-Pro 与 V4-Flash;100 万 token 上下文成为默认,引入稀疏注意力(DSA),开源权重上线 Hugging Face。
OpenAI 发布 GPT-5.5:主打智能体编程与计算机使用
OpenAI 推出 GPT-5.5,面向智能体编程、计算机使用与知识型工作;Terminal-Bench 2.0 达 82.7%,API 定价 5/30 美元每百万 token,支持 100 万上下文。
Anthropic 完成 300 亿美元 G 轮融资,估值 3800 亿美元
Anthropic 宣布完成 300 亿美元 G 轮融资,投后估值 3800 亿美元,由 GIC 与 Coatue 领投;公司年化营收达 140 亿美元。
Google 发布 Gemini 3 Pro:LMArena 1501 Elo 登顶
Google 推出 Gemini 3 Pro,以 1501 Elo 登顶 LMArena;GPQA Diamond 91.9%、SWE-bench Verified 76.2%,100 万 token 上下文,并首发 Deep Think 模式。
OpenAI 重组为公益公司,微软持股约 27%
OpenAI 完成重组为公益公司(PBC),非营利母体保留控制权;微软持有约 27%、价值约 1350 亿美元,OpenAI 承诺增购 2500 亿美元 Azure 服务。
OpenAI 发布 GPT-5:统一系统 + 自动路由,成为 ChatGPT 新默认
OpenAI 推出 GPT-5——一个集成快速回答与 GPT-5 Thinking 的统一系统,成为所有 ChatGPT 用户的默认模型;AIME 2025 无工具 94.6%、SWE-bench Verified 74.9%。
欧盟《AI 法案》通用 AI(GPAI)义务正式生效
2025 年 8 月 2 日起,欧盟《AI 法案》针对通用人工智能(GPAI)模型的义务与治理规则开始适用,GPAI 提供方须满足透明度与版权相关要求。
Gemini Deep Think 在国际数学奥林匹克拿到金牌级成绩
Google DeepMind 的 Gemini Deep Think 在 IMO 2025 拿下 35/42 的金牌级分数,解出 6 题中的 5 题,并由 IMO 官方确认。
Anthropic 发布 Claude 4:Opus 4 与 Sonnet 4,SWE-bench 双双破 72%
Anthropic 推出 Claude Opus 4 与 Claude Sonnet 4,混合即时/扩展思考;SWE-bench Verified 上 Opus 4 达 72.5%、Sonnet 4 达 72.7%。
OpenAI 发布 o3 + o4-mini:推理模型首次原生使用所有工具
OpenAI 在 4 月 16 日发布 o3 和 o4-mini。第一次让推理模型 agentically 调用 ChatGPT 全部工具——搜索、Python、图像生成、视觉分析。ARC-AGI 上比 o1 准确率高 3 倍。
Meta 开源 Llama 4:原生多模态 MoE,Scout 上下文达 1000 万 token
Meta 发布 Llama 4 Scout 与 Maverick——首批开放权重的原生多模态 MoE 模型。Scout 上下文达 1000 万 token,万亿级的 Behemoth 仍在训练中。
Gemini 2.5 Pro 发布:Google 首个「思考型」模型登顶 LMArena
Google 推出 Gemini 2.5 Pro Experimental——一个会先思考再回答的推理模型,发布即登顶 LMArena,100 万 token 上下文(200 万即将到来)。
Claude 3.7 Sonnet 发布:首个集成推理模式的旗舰模型
Anthropic 推出 Claude 3.7 Sonnet 和 Claude Code CLI——用户可控制 thinking 时长,编码能力 SWE-bench 70.3% 大幅领先同档。
xAI 发布 Grok 3:10× 训练算力,引入 Think 模式 + DeepSearch
Musk 旗下 xAI 发布 Grok 3,用 20 万张 H100 集群 Colossus 训练(10× Grok-2)。引入推理 Think 模式 + 联网搜索 DeepSearch,AIME / GPQA 上号称超 GPT-4o。
OpenAI 发布 o3-mini:推理模型平民化,免费 ChatGPT 用户也能用
OpenAI 在 DeepSeek R1 发布后 10 天紧急推出 o3-mini,性价比大幅提升。低 / 中 / 高三档“推理强度”任选,编码、数学、科学专业领域全面提升。
DeepSeek R1 开源发布:推理能力对标 OpenAI o1,训练成本仅 $5.6M
DeepSeek 发布 R1,在 AIME 数学竞赛、Codeforces 等推理基准上达到 o1 级水平。模型 + 权重 + 训练方法全部开源(MIT 协议),训练成本仅 $5.6M。
美国发布 AI Diffusion Rule:把全球分三档管控 AI 芯片出口
Biden 政府 1 月 15 日发布「AI Diffusion 框架」——按国家分三档管控 H100 等高端 AI 芯片出口。5 月被 Trump 政府撤销,但确立了「算力 = 战略资源」的监管思路。
Google 发布 Gemini 2.0 Flash:原生多模态 + Agent 能力
Gemini 2.0 Flash 首次原生支持图像、音频流输出 + 工具使用 + 多模态实时 API。Google 第二代旗舰,性能超越 Gemini 1.5 Pro 同时速度 2 倍。
Meta 发布 Llama 3.3 70B:70B 性能接近 405B 旗舰
Llama 3.3 70B 通过改进训练 + 后训练对齐,让 70B 模型在多数基准上接近 Llama 3.1 405B。推理 / 部署成本大幅降低,开源生态获益。
Google DeepMind 发布 Genie 2:从一张图生成可玩 3D 世界
DeepMind 发布 Genie 2 世界模型——从单张图像 + 文字描述就能生成可交互的 3D 环境,物体交互 / 光照 / 物理 / NPC 全自动模拟。具身智能的关键基础。