HelloAI
research · 2024/12/4 16:00:00

Google DeepMind 发布 Genie 2:从一张图生成可玩 3D 世界

DeepMind 发布 Genie 2 世界模型——从单张图像 + 文字描述就能生成可交互的 3D 环境,物体交互 / 光照 / 物理 / NPC 全自动模拟。具身智能的关键基础。

来源:Google DeepMind 查看原文 →

Google DeepMind 12 月 4 日发布 Genie 2 —— 一个能从单张图像 + 文字描述生成可交互 3D 世界的基础模型。

关键能力:

1. 输入极简

  • 一张图(可以是 AI 生成的 Imagen 3 图,也可以是真实照片或概念画)
  • 一句文字描述(“a cute humanoid robot in the woods”)

2. 输出 = 可玩的 3D 世界

  • 用户用鼠标 / 键盘操控(跳 / 游 / 走)
  • 物体交互、动画、光照、物理、反射、NPC 行为全自动模拟
  • 训练数据是大量视频

3. 用途

  • 具身智能 agent(embodied AI、机器人)提供可大量生成的训练环境
  • 想象一下:
    • “无穷的多样化环境” → 让 RL agent 学到通用策略
    • 这是机器人 / 自动驾驶训练的核心瓶颈
    • Genie 2 可能解决”模拟环境不够丰富”的问题

4. 状态

  • 研究预览:不对公众开放,仅授权部分研究者
  • 是”基础模型”——后续会演化更强版本

编辑批注:Sora 是”生成视频”,Genie 是”生成可玩世界”。 后者比前者更难——但更接近”具身智能 + AGI”的本质。 这是 DeepMind 押注”World Model” 路线的关键节点。

Genie 2 公告(DeepMind 官方) · TechCrunch 报道