机器人 + LLM:VLA 模型与具身智能
PaLM-E、RT-2、π0、Optimus——LLM 与机器人正式融合,"看 + 想 + 动"成为一个模型。2026 具身智能新格局。
L5-07 讲了 3D 生成(数字世界)。 这一篇讲:把 LLM 装到机器人里——AI 真的”动起来”操作物理世界。
这是 AI 下一个 10× 增长方向—— 具身智能(embodied AI)。
VLA:Vision-Language-Action 模型
核心思想:让一个模型同时处理三种东西:
- Vision 看:摄像头输入
- Language 听 / 读:人的指令
- Action 动:输出机器人关节角度 / 抓握力度
这一类模型简称 VLA 模型——传统机器人控制(写脚本 / 强化学习)的换代品。
[摄像头看到的画面] + [人说:"请把桌上的杯子拿给我"]
↓
VLA 模型
↓
[机器人各关节的动作序列:肩 30° / 肘 -20° / 腕 15° / 抓握 80%]
关键里程碑
1. PaLM-E(Google, 2023-03)
第一个有影响力的 VLA:
- 把 PaLM(LLM)+ ViT(视觉)+ 机器人状态编码器结合
- 5620 亿参数(当时最大具身模型)
- 在多任务上证明 LLM-style 模型可以做机器人控制
意义:LLM 路线在机器人上能 work。
2. RT-2(Google DeepMind, 2023-07)
进一步:
- 用互联网图像 + 文本预训练
- 然后用机器人示范数据 fine-tune
- “看图说话” 的能力迁移到 “看图操作”
- 第一次展示 “emergent capability”——能识别没训练过的物体(如”识别 Taylor Swift 海报”)
3. π0(Physical Intelligence, 2024-10)
新一代旗舰开源 VLA:
关键数字:
- 2024 年初 Physical Intelligence 由 Sergey Levine 等创立
- 种子轮 400M 后续,估值 $2B
- 2024-10-31 发布 π0
- 2025-02-04 开源权重 + 代码(+ π0-FAST autoregressive 版本)
- 2025-04-22 发布 π0.5:能在完全没见过的厨房 / 卧室做 open-world 清理
技术特点:
- 训练数据 10000+ 小时机器人示范
- Flow matching 路线(不是传统 autoregressive)
- 基础模型 + fine-tune 模式(vs 每个任务从头训)
意义:
- 第一个真正开源的高质量 VLA 基础模型
- 让学术 / 创业团队不需要自己采集数据 就能开发机器人应用
4. Tesla Optimus(2022+)
特斯拉的人形机器人:
- 2024 / 2025 多次公开 demo
- 视觉端 → 类似 FSD 的神经网络
- 动作端 → 模仿学习 + 仿真训练
- 2025 商业化目标:**100K+)
5. Figure AI / 1X / Apptronik(人形机器人创业三巨头)
- Figure 02(2024):和 OpenAI 合作,跑 GPT-4o 做对话
- 1X NEO:北欧人形,对话 + 家用任务
- Apptronik Apollo:和 NASA / Mercedes 合作仓库 / 装配
2024-2026 是人形机器人 + LLM 融合的关键窗口。
技术挑战
1. 数据稀缺
LLM 有互联网级文本;视觉模型有数十亿张图。 机器人数据:几千小时——少了6 个数量级。
解决方向:
- 仿真(Isaac Sim / MuJoCo)——便宜但 sim-to-real gap
- 大规模示范采集(RT-X 联盟:22 个实验室共享数据)
- 跨实体迁移(一个机器人的数据帮另一个)
2. 泛化难
LLM 在文本任务上零样本就 work。 机器人:没在训练分布里的环境 频繁失败。
π0.5 的进步:第一次在”open world”(陌生厨房)展示有用的泛化。
3. 物理约束
LLM 输出错了就错了;机器人输出错了砸碎东西 / 撞伤人。
- 必须有力觉感知 + 紧急停止
- 安全层(Safety Layer)和 LLM 决策层分开
4. 延迟
LLM 推理 100ms-2s——这对实时控制(毫秒级)来说太慢。
主流架构:
- 高层规划(慢、用大 VLA):5-10Hz
- 低层控制(快、传统控制器):100-1000Hz
5. 能耗 / 算力
人形机器人电池续航 1-4 小时—— 跑大模型很费电。VLA 必须蒸馏到边缘端(NVIDIA Jetson 等)。
与传统机器人的差异
| 维度 | 传统机器人 | VLA Agent |
|---|---|---|
| 编程方式 | 写代码 / 录制 | 自然语言 + 示范 |
| 环境适应性 | 严格结构化 | 一定泛化能力 |
| 跨任务 | 每个任务重写 | 一个模型多任务 |
| 学习 | 静态部署 | 可持续学习 |
| 失败模式 | 卡死 / 错误码 | 像人一样”尝试” |
应用场景
短期(2026-2028)已可见:
- 仓库 / 物流:分拣、搬运(Amazon、Figure 在用)
- 家用清洁:吸尘 / 整理(消费级试水)
- 餐厅 / 厨房:配菜、清洁
- 工业装配:可变线(Mercedes 用 Apptronik)
中期(2028-2030):
- 家庭通用机器人:购物、洗碗、辅助老人
- 建筑 / 农业:受限环境的灵活作业
- 医疗 / 护理辅助
长期开放:
- 完全自主家用 AGI 机器人
- 人机协作工厂
创业 / 投资格局
人形机器人公司估值(2026 量级):
- Figure AI:$26B+
- 1X:~$2B+
- Apptronik:~$2B+
- Physical Intelligence:$2B+
- Skild:$1.5B+
- Optimus(Tesla 内部):估算几百亿独立价值
模型层(VLA 基础):
- Physical Intelligence(最公开)
- Google DeepMind(内部 Gemini Robotics)
- NVIDIA Isaac GR00T
这个赛道资本密集——和 LLM 一样烧钱,但目标市场(劳动力替代)更大。
与 LLM 时代的对比
时间线类比:
| LLM 时代 | 机器人时代 |
|---|---|
| 2017 Transformer | 2023 PaLM-E / RT-2 |
| 2020 GPT-3 | 2024-10 π0 |
| 2022 ChatGPT 出圈 | 2026-2027 待定 |
| 2025-2026 大规模应用 | 2028-2030 预期 |
如果类比成立,我们正处在”机器人版的 2020 GPT-3 时刻”。 技术已经从 0 → 1,但还差 1 → 100 的工程化突破。
学习路径
想入行的人:
- 数学 / Python 基础(L1)
- RL(强化学习)基础
- 仿真:Isaac Sim / MuJoCo / Drake
- ROS 2(机器人操作系统)
- 至少跑通 π0 开源代码(HuggingFace 有教程)
- 找实验室 / 公司实习
关键开源项目:
- openpi (Physical Intelligence)
- LeRobot (HuggingFace)
- Octo
- Open X-Embodiment 数据集
LLM 把 “智能” 从硬件中解耦—— VLA 把 “智能” 重新装回硬件。
2010s 软件吞噬世界(Software eats the world) 2020s LLM 吞噬软件 2030s 机器人 + AI 吞噬物理世界?
但注意:人形机器人家用化比 LLM 普及难得多——
- 安全要求 (LLM 出错 = 文字幻觉;机器人出错 = 物理伤害)
- 售价(20/月订阅)
- 维护 / 续航 / 更新
职业建议:
- 如果你在 LLM 圈但想做”下一个浪潮”,机器人 + VLA 是最大概率的下一站
- 学RL + 仿真 + ROS 是稀缺技能
- 这个浪潮还在 0 → 1 阶段,进入门槛比 LLM 现在低
推荐配套阅读
- HelloAI L5-01 多模态总览
- HelloAI L5-07 3D 生成
- HelloAI L6-01 为什么需要 AI 对齐(具身智能的对齐挑战更大)
- 论文:RT-2 / OpenVLA / π0
- Physical Intelligence 官网
- HuggingFace LeRobot
🚧 3 个常见坑
坑 1:低估 sim-to-real gap 仿真里 95% 成功率,真机 30% 很常见——光在仿真训练不够,真机数据是金子。
坑 2:所有任务一个 VLA 就算 π0 这种通用模型,针对具体场景 fine-tune 仍能大幅提升——基础模型 ≠ 终端产品。
坑 3:忽视安全层 LLM 决定”该怎么动”,但永远要有传统控制器 + 力觉传感器做最后一道防线——不能让 LLM 决策直接驱动电机。
读到这里说明你认真在学 🎯
订阅每周精选 —— 下一篇新文章 / 新可视化第一时间送到邮箱。
讨论区
· 用 GitHub 账号登录评论src/components/Comments.astro 顶部填入
仓库 ID 和分类 ID(见组件注释里的配置步骤)。