research · 2024/12/4 16:00:00
Google DeepMind 发布 Genie 2:从一张图生成可玩 3D 世界
DeepMind 发布 Genie 2 世界模型——从单张图像 + 文字描述就能生成可交互的 3D 环境,物体交互 / 光照 / 物理 / NPC 全自动模拟。具身智能的关键基础。
来源:Google DeepMind
查看原文 →
Google DeepMind 12 月 4 日发布 Genie 2 —— 一个能从单张图像 + 文字描述生成可交互 3D 世界的基础模型。
关键能力:
1. 输入极简
- 一张图(可以是 AI 生成的 Imagen 3 图,也可以是真实照片或概念画)
- 一句文字描述(“a cute humanoid robot in the woods”)
2. 输出 = 可玩的 3D 世界
- 用户用鼠标 / 键盘操控(跳 / 游 / 走)
- 物体交互、动画、光照、物理、反射、NPC 行为全自动模拟
- 训练数据是大量视频
3. 用途
- 为具身智能 agent(embodied AI、机器人)提供可大量生成的训练环境
- 想象一下:
- “无穷的多样化环境” → 让 RL agent 学到通用策略
- 这是机器人 / 自动驾驶训练的核心瓶颈
- Genie 2 可能解决”模拟环境不够丰富”的问题
4. 状态
- 研究预览:不对公众开放,仅授权部分研究者
- 是”基础模型”——后续会演化更强版本
编辑批注:Sora 是”生成视频”,Genie 是”生成可玩世界”。 后者比前者更难——但更接近”具身智能 + AGI”的本质。 这是 DeepMind 押注”World Model” 路线的关键节点。