← 可视化 /

🤖 VLA 模型:看 + 想 + 动

L5-09

Vision + Language + Action 三合一

输入:摄像头画面 + 自然语言任务。输出:机械臂关节角度序列。

desk camera view (400×300)
● REC
1 · Vision encoder
看到: 红色方块 @ (170, 191) 蓝色方块 @ (230, 191)
2 · Language
目标:抓取 red block,移到桌子右边(x > 300)
3 · Action(关节角度序列)
shoulder
elbow
gripper
0%
4 · 反馈循环
等待执行...

⚙️ 真实 VLA 架构

π0 这类生产级 VLA 模型实际上分两层:

→ 配套阅读:L5-09 机器人 + LLM