HelloAI
L5 第 9 篇 🐥 难度 🕒 9 分钟

机器人 + LLM:VLA 模型与具身智能

PaLM-E、RT-2、π0、Optimus——LLM 与机器人正式融合,"看 + 想 + 动"成为一个模型。2026 具身智能新格局。

阿莱
2026/9/27

L5-07 讲了 3D 生成(数字世界)。 这一篇讲:把 LLM 装到机器人里——AI 真的”动起来”操作物理世界

这是 AI 下一个 10× 增长方向—— 具身智能(embodied AI)

VLA:Vision-Language-Action 模型

核心思想:让一个模型同时处理三种东西:

  • Vision 看:摄像头输入
  • Language 听 / 读:人的指令
  • Action 动:输出机器人关节角度 / 抓握力度

这一类模型简称 VLA 模型——传统机器人控制(写脚本 / 强化学习)的换代品。

[摄像头看到的画面] + [人说:"请把桌上的杯子拿给我"]

           VLA 模型

[机器人各关节的动作序列:肩 30° / 肘 -20° / 腕 15° / 抓握 80%]

关键里程碑

1. PaLM-E(Google, 2023-03)

第一个有影响力的 VLA

  • 把 PaLM(LLM)+ ViT(视觉)+ 机器人状态编码器结合
  • 5620 亿参数(当时最大具身模型)
  • 在多任务上证明 LLM-style 模型可以做机器人控制

意义:LLM 路线在机器人上能 work

2. RT-2(Google DeepMind, 2023-07)

进一步:

  • 用互联网图像 + 文本预训练
  • 然后用机器人示范数据 fine-tune
  • 看图说话” 的能力迁移到 “看图操作
  • 第一次展示 “emergent capability”——能识别没训练过的物体(如”识别 Taylor Swift 海报”)

3. π0(Physical Intelligence, 2024-10)

新一代旗舰开源 VLA:

关键数字

  • 2024 年初 Physical Intelligence 由 Sergey Levine 等创立
  • 种子轮 70M2024年底70M**,**2024 年底 400M 后续,估值 $2B
  • 2024-10-31 发布 π0
  • 2025-02-04 开源权重 + 代码(+ π0-FAST autoregressive 版本)
  • 2025-04-22 发布 π0.5:能在完全没见过的厨房 / 卧室做 open-world 清理

技术特点

  • 训练数据 10000+ 小时机器人示范
  • Flow matching 路线(不是传统 autoregressive)
  • 基础模型 + fine-tune 模式(vs 每个任务从头训)

意义

  • 第一个真正开源的高质量 VLA 基础模型
  • 让学术 / 创业团队不需要自己采集数据 就能开发机器人应用

4. Tesla Optimus(2022+)

特斯拉的人形机器人:

  • 2024 / 2025 多次公开 demo
  • 视觉端 → 类似 FSD 的神经网络
  • 动作端 → 模仿学习 + 仿真训练
  • 2025 商业化目标:**20K30K家用单价(vs工业机器人20K-30K**家用单价(vs 工业机器人 100K+)

5. Figure AI / 1X / Apptronik(人形机器人创业三巨头)

  • Figure 02(2024):和 OpenAI 合作,跑 GPT-4o 做对话
  • 1X NEO:北欧人形,对话 + 家用任务
  • Apptronik Apollo:和 NASA / Mercedes 合作仓库 / 装配

2024-2026 是人形机器人 + LLM 融合的关键窗口。

技术挑战

1. 数据稀缺

LLM 有互联网级文本;视觉模型有数十亿张图。 机器人数据:几千小时——少了6 个数量级

解决方向:

  • 仿真(Isaac Sim / MuJoCo)——便宜但 sim-to-real gap
  • 大规模示范采集(RT-X 联盟:22 个实验室共享数据)
  • 跨实体迁移(一个机器人的数据帮另一个)

2. 泛化难

LLM 在文本任务上零样本就 work。 机器人:没在训练分布里的环境 频繁失败。

π0.5 的进步:第一次在”open world”(陌生厨房)展示有用的泛化。

3. 物理约束

LLM 输出错了就错了;机器人输出错了砸碎东西 / 撞伤人

  • 必须有力觉感知 + 紧急停止
  • 安全层(Safety Layer)和 LLM 决策层分开

4. 延迟

LLM 推理 100ms-2s——这对实时控制(毫秒级)来说太慢。

主流架构:

  • 高层规划(慢、用大 VLA):5-10Hz
  • 低层控制(快、传统控制器):100-1000Hz

5. 能耗 / 算力

人形机器人电池续航 1-4 小时—— 跑大模型很费电。VLA 必须蒸馏到边缘端(NVIDIA Jetson 等)。

与传统机器人的差异

维度传统机器人VLA Agent
编程方式写代码 / 录制自然语言 + 示范
环境适应性严格结构化一定泛化能力
跨任务每个任务重写一个模型多任务
学习静态部署可持续学习
失败模式卡死 / 错误码像人一样”尝试”

应用场景

短期(2026-2028)已可见

  • 仓库 / 物流:分拣、搬运(Amazon、Figure 在用)
  • 家用清洁:吸尘 / 整理(消费级试水)
  • 餐厅 / 厨房:配菜、清洁
  • 工业装配:可变线(Mercedes 用 Apptronik)

中期(2028-2030)

  • 家庭通用机器人:购物、洗碗、辅助老人
  • 建筑 / 农业:受限环境的灵活作业
  • 医疗 / 护理辅助

长期开放

  • 完全自主家用 AGI 机器人
  • 人机协作工厂

创业 / 投资格局

人形机器人公司估值(2026 量级):

  • Figure AI:$26B+
  • 1X:~$2B+
  • Apptronik:~$2B+
  • Physical Intelligence:$2B+
  • Skild:$1.5B+
  • Optimus(Tesla 内部):估算几百亿独立价值

模型层(VLA 基础)

  • Physical Intelligence(最公开)
  • Google DeepMind(内部 Gemini Robotics)
  • NVIDIA Isaac GR00T

这个赛道资本密集——和 LLM 一样烧钱,但目标市场(劳动力替代)更大。

与 LLM 时代的对比

时间线类比:

LLM 时代机器人时代
2017 Transformer2023 PaLM-E / RT-2
2020 GPT-32024-10 π0
2022 ChatGPT 出圈2026-2027 待定
2025-2026 大规模应用2028-2030 预期

如果类比成立,我们正处在”机器人版的 2020 GPT-3 时刻”。 技术已经从 0 → 1,但还差 1 → 100 的工程化突破。

学习路径

想入行的人

  1. 数学 / Python 基础(L1)
  2. RL(强化学习)基础
  3. 仿真:Isaac Sim / MuJoCo / Drake
  4. ROS 2(机器人操作系统)
  5. 至少跑通 π0 开源代码(HuggingFace 有教程)
  6. 找实验室 / 公司实习

关键开源项目

💡 一个判断

LLM 把 “智能” 从硬件中解耦—— VLA 把 “智能” 重新装回硬件

2010s 软件吞噬世界(Software eats the world) 2020s LLM 吞噬软件 2030s 机器人 + AI 吞噬物理世界

注意:人形机器人家用化比 LLM 普及难得多——

  • 安全要求 (LLM 出错 = 文字幻觉;机器人出错 = 物理伤害)
  • 售价(20Kvs20K vs 20/月订阅)
  • 维护 / 续航 / 更新

职业建议

  • 如果你在 LLM 圈但想做”下一个浪潮”,机器人 + VLA 是最大概率的下一站
  • RL + 仿真 + ROS 是稀缺技能
  • 这个浪潮还在 0 → 1 阶段,进入门槛比 LLM 现在低

推荐配套阅读

🚧 3 个常见坑

⚠️ 实战避坑

坑 1:低估 sim-to-real gap 仿真里 95% 成功率,真机 30% 很常见——光在仿真训练不够,真机数据是金子。

坑 2:所有任务一个 VLA 就算 π0 这种通用模型,针对具体场景 fine-tune 仍能大幅提升——基础模型 ≠ 终端产品。

坑 3:忽视安全层 LLM 决定”该怎么动”,但永远要有传统控制器 + 力觉传感器做最后一道防线——不能让 LLM 决策直接驱动电机。

📬

读到这里说明你认真在学 🎯

订阅每周精选 —— 下一篇新文章 / 新可视化第一时间送到邮箱。

💬

讨论区

· 用 GitHub 账号登录评论
⚠️ Giscus 评论未配置 —— 在 src/components/Comments.astro 顶部填入 仓库 ID 和分类 ID(见组件注释里的配置步骤)。