HelloAI
📄 论文精读 🏆 必读经典 · 2025 · OpenAI · System Card 2025-09

Sora 2 System Card: 10-25 秒视频 + 同步音轨 + 角色注入

OpenAI
📖 如果你只读一段,读这段
Sora 2 在 2025-09-30 发布——10-25 秒视频 + 同步音频(对话 + 音效)首次集成、物理一致性大幅提升、用一段参考视频就能把人物/物体注入任意 Sora 场景。Sora 产品已于 2026-04-26 停止运营。
#Sora#Video#OpenAI#World Model#Diffusion#必读

为什么这篇 System Card 重要

OpenAI 2024-02 发布 Sora 1 引爆视频生成讨论。 Sora 2 的 System Card(2025-09-30)是视频生成里程碑文档—— 它把视频 AI 从”看起来还行的 demo”推到”产品级可用”。

但同样令人惊讶的是——Sora 产品 2026-04-26 停止运营。 这份 System Card 同时记录了它的能力和它的商业失败。

核心能力(vs Sora 1)

维度Sora 1 (2024)Sora 2 (2025-09)
时长最多 60s(实际不稳定)10-25s(稳定)
音频同步对话 + 音效 + 环境音
物理一致性一般大幅提升(篮球反弹、流体动力学接近真实)
角色一致性同场景内基本一致跨场景 + 跨视频
多镜头单镜头为主多镜头持续叙事

关键创新

1. 角色 / 物体注入(Cameo)

最被广泛模仿的能力:

[参考视频:30 秒,展示一个人物]
            +
[Prompt:在咖啡厅、在海边、在公园 3 个场景]

       Sora 2 输出

[同一人物在 3 个不同场景,外貌、声音保持一致]

意义

  • 第一次商业化”AI 演员”——一段参考视频 → 无限二次创作
  • 对内容创作者:拍一段自己 → 让 AI 帮你”出演”任意故事
  • 对版权:引发”deepfake 商品化”的伦理 / 法律讨论

2. 同步音频

视频生成同时输出:

  • 对话:唇形与语音匹配
  • 音效:物体碰撞 / 脚步 / 环境声
  • 环境音:风声、海浪、车流

这是和 Veo 3 同步发布的同一代能力——视频 + 音频不再分两套模型。

3. 物理一致性的”涌现”

System Card 强调:Sora 2 不是显式被训过物理规则,但表现出:

  • 篮球未进会反弹回来(Sora 1 经常消失)
  • 液体倾倒 → 飞溅 → 静止合理
  • 重力 / 摩擦 / 弹性都”基本对”

注:这不是”理解物理”,是统计学习得到的”看起来物理对”—— 仍然会在罕见情况犯错(拓扑变形、不可能动作)。

4. Multi-shot Controllability

prompt 可以指定多个镜头:

[Shot 1: wide angle of city]
[Shot 2: close-up of a person walking]
[Shot 3: pan to sunset]

Sora 2 保持人物 / 环境 / 风格一致 → 真正的”短视频导演”能力。

系统架构(推测)

System Card 未公开完整架构。业界共识:

  • Diffusion Transformer (DiT) 主干——Sora 1 的延续
  • 空间 + 时间 patch:视频切成 4D patch
  • 视觉 + 音频联合 codec
  • 角色注入:基于 reference video 提取 identity embedding
  • 推测训练用 数百万小时视频 + 大规模 RLHF / DPO 对齐

安全 / 防滥用

System Card 强调的措施:

  • C2PA watermark:所有 Sora 2 输出嵌入不可见 + 可见水印
  • 人脸 / 公众人物过滤:拒绝生成已知政治人物 / 名人
  • 暴力 / NSFW 过滤器:训练时过滤 + 输出时检测
  • Red Team 报告:发布前外部红队 6 个月测试

实际效果:上线后大量”绕过水印”案例 + 大量明星 deepfake 投诉。

为什么 Sora 商业失败(2026-04-26 停运)

System Card 是产品上线时的文档——但仅半年后产品就停了。 完整故事在 OpenAI 内部,但公开能看到的:

1. 成本难以平衡

  • 单条视频生成成本几美元到几十美元
  • 用户付 $20-200/月想生成”无限视频”
  • 单位经济模型不成立

2. 法律风险

  • 多个州 / 国家关于 deepfake 的新立法
  • 个人 / 公众人物起诉
  • 内容审核团队 burden 极大

3. 应用层公司更适合

  • Runway / Kling / Veo 都在持续运营——他们做的是专业工具
  • Sora 作为消费产品定位含糊
  • OpenAI 自己也更想专注 LLM 主线

4. Veo 3 / Kling 2 直接竞争

Google Veo 3 质量持平 + Google Workspace 集成; Kling 国内用户基础大。 Sora 2 “OpenAI 品牌” 没能转化成可持续业务。

OpenAI 在 stop 公告中说”将继续投入视频研究——但商业产品形态需要重新思考”。

它真正留下的遗产

虽然产品没活下来,Sora 2 的影响仍持续:

  1. 技术标杆:定义了”视频生成 SOTA”的标准
  2. 角色注入范式:被 Runway / Kling 等迅速复制
  3. C2PA 水印:第一个大规模 AI 视频水印实践
  4. 物理一致性:World Model 路线的重要数据点

推荐配套阅读

💡 一个观察

Sora 2 是 AI 产品史上奇特的存在技术上达到了 SOTA,但商业上仅存活 7 个月

它证明了:技术领先 ≠ 产品成功。 视频生成的可行商业模式仍未明朗——Runway / Kling 在专业市场活着,但消费级仍是问号。

后续:OpenAI 把视频研究并入”World Model” 主线——可能服务于具身智能(机器人 + 自动驾驶 + 仿真)。

📬

想要更多论文精读

订阅每周精选 —— 下一篇论文笔记直接送邮箱。

💬

讨论区

· 用 GitHub 账号登录评论
⚠️ Giscus 评论未配置 —— 在 src/components/Comments.astro 顶部填入 仓库 ID 和分类 ID(见组件注释里的配置步骤)。