← 可视化
/
🤖 VLA 模型:看 + 想 + 动
L5-09
Vision + Language + Action 三合一
输入:摄像头画面 + 自然语言任务。输出:机械臂关节角度序列。
▶ 执行
↺ 重置
desk
camera view (400×300)
● REC
1 · Vision encoder
看到:
红色方块
@ (170, 191)
蓝色方块
@ (230, 191)
2 · Language
目标:抓取
red block
,移到桌子右边(x > 300)
3 · Action(关节角度序列)
shoulder
0°
elbow
0°
gripper
0%
4 · 反馈循环
等待执行...
⚙️ 真实 VLA 架构
π0 这类生产级 VLA 模型实际上分两层:
高层 VLA 规划
(5-10Hz):大模型决定"下一步去哪"
低层传统控制
(100-1000Hz):实时控制器把目标转成电机指令
安全层
:力觉传感器 + 紧急停止 —— LLM 错了不能直接砸到东西
→ 配套阅读:L5-09 机器人 + LLM