机器人架构演进与端到端技术深度解析
机器人从工业流水线的机械臂,走到能跑能跳能抓取的通用人形,背后是一场关于"如何让机器自主行动"的架构演进。感知、定位、规划、控制、平衡这五个能力的组合方式,决定了机器人的智能上限。本文从能力分解切入,对比传统 Pipeline 与端到端两条技术路线,结合 ROS2、OpenVLA、Octo、Isaac Lab、RT-X 等主流开源项目,把机器人架构与端到端技术讲透。
一、五大核心能力构筑机器人自主行为
机器人要能在物理世界自主完成任务,至少需要五个核心能力环环相扣。感知负责把外部世界变成机器能理解的信号,定位回答"我在哪",规划决定"怎么走",控制把规划落地成关节动作,平衡则在动态运动中维持姿态稳定。
1.1 五大核心能力链路
flowchart TB
A(["🔴 输入信号"])
P1["感知<br/>看到听到触摸"]
P2["定位<br/>知道自己在哪"]
P3["规划<br/>想好怎么走"]
P4["控制<br/>关节动起来"]
P5["平衡<br/>保持不摔倒"]
Z(["✅ 自主行动"])
A --> P1
P1 --> P2
P2 --> P3
P3 --> P4
P4 --> P5
P5 --> Z
style A fill:#E8F5E9,stroke:#388E3C
style P1 fill:#E3F2FD,stroke:#1976D2,stroke-width:2px
style P2 fill:#E3F2FD,stroke:#1976D2,stroke-width:2px
style P3 fill:#E3F2FD,stroke:#1976D2,stroke-width:2px
style P4 fill:#E3F2FD,stroke:#1976D2,stroke-width:2px
style P5 fill:#E3F2FD,stroke:#1976D2,stroke-width:2px
style Z fill:#E8F5E9,stroke:#388E3C
| 能力 |
通俗理解 |
人的类比 |
| 感知 |
看到障碍物、听到指令 |
眼睛、耳朵、皮肤 |
| 定位 |
知道自己相对地图的位置 |
记路 |
| 规划 |
规划从A点到B点的路径 |
想好怎么走 |
| 控制 |
把路径变成关节动作 |
大脑指挥手脚 |
| 平衡 |
摔倒时调整姿态 |
小脑保持平衡 |
1.2 各能力输入输出对应关系
每个能力都有明确的输入和输出契约。感知把原始传感器数据变成结构化环境描述,定位把传感器读数变成位姿估计,规划把起点终点变成轨迹序列,控制把目标姿态变成关节指令。
flowchart TB
subgraph S1["感知"]
direction TB
S1_IN["相机/激光<br/>原始数据"]
S1_OUT["前方有桌子<br/>左3米有墙"]
end
subgraph S2["定位"]
direction TB
S2_IN["激光+地图"]
S2_OUT["我在(3,5)<br/>面朝北"]
end
subgraph S3["规划"]
direction TB
S3_IN["起点+终点<br/>+地图"]
S3_OUT["直走2米<br/>再左转"]
end
subgraph S4["控制"]
direction TB
S4_IN["目标关节角"]
S4_OUT["左膝30°<br/>右膝28°"]
end
S1_IN --> S1_OUT
S2_IN --> S2_OUT
S3_IN --> S3_OUT
S4_IN --> S4_OUT
style S1 fill:#E8F5E9,stroke:#388E3C
style S2 fill:#F3E5F5,stroke:#7B1FA2
style S3 fill:#FFF8E1,stroke:#F57C00
style S4 fill:#E3F2FD,stroke:#1976D2
二、感知到控制全链路模型选型策略
每个能力都对应一组成熟模型。传统算法和神经网络各有适用场景,关键看任务对延迟、泛化、可解释性的要求。
2.1 模型选型总览
flowchart TB
subgraph T1["感知"]
direction TB
M1["CNN/YOLO<br/>目标检测"]
end
subgraph T2["定位"]
direction TB
M2["AMCL/粒子滤波<br/>位置估计"]
end
subgraph T3["规划"]
direction TB
M3["A*/DWA/RL<br/>路径规划"]
end
subgraph T4["控制"]
direction TB
M4["PID/MPC/MLP<br/>运动控制"]
end
subgraph T5["平衡"]
direction TB
M5["AMP/WMP<br/>运动先验"]
end
T1 --> T2
T2 --> T3
T3 --> T4
T4 --> T5
style T1 fill:#E8F5E9,stroke:#388E3C
style T2 fill:#F3E5F5,stroke:#7B1FA2
style T3 fill:#FFF8E1,stroke:#F57C00
style T4 fill:#E3F2FD,stroke:#1976D2
style T5 fill:#FFEBEE,stroke:#D32F2F
2.2 各功能详细模型对照
| 功能 |
传统模型 |
神经网络模型 |
通俗理解 |
| 感知 |
规则/SVM |
CNN/ViT/YOLO |
机器人眼睛 |
| 定位 |
粒子滤波/EKF |
PoseNet/视觉里程计 |
机器人记路 |
| 规划 |
A*/Dijkstra |
RL Policy |
机器人想路线 |
| 控制 |
PID/MPC |
MLP/Transformer |
机器人大脑 |
| 平衡 |
PID |
AMP/WMP |
机器人小脑 |
2.3 机械臂与腿足控制差异
手臂的核心挑战是精准定位,腿足的核心挑战是动态平衡。两者的输入空间、动作维度、训练难度都不一样,对应的模型选型也有差异。
flowchart TB
subgraph LEG["腿足运动"]
direction TB
L1["挑战 保持平衡"]
L2["输入 关节+IMU+触地"]
L3["输出 关节力矩"]
L4["代表 四足人形走路"]
end
subgraph ARM["手臂操作"]
direction TB
A1["挑战 精准定位"]
A2["输入 视觉+关节角"]
A3["输出 关节+夹爪"]
A4["代表 机械臂抓取"]
end
style LEG fill:#E8F5E9,stroke:#388E3C
style ARM fill:#F3E5F5,stroke:#7B1FA2
| 维度 |
腿足 |
手臂 |
| 核心挑战 |
保持平衡 |
精准定位 |
| 主要传感器 |
IMU、足底力 |
视觉、触觉 |
| 动作空间 |
12+ DOF |
6-7 DOF |
| RL难度 |
高 |
中等 |
三、传统流水线与端到端架构核心对比
机器人架构演进的主线,就是从分模块流水线走向端到端神经网络。两条路线各有优劣,关键在于任务是否需要可解释性和模块化调试。
3.1 两种架构对比
flowchart TB
subgraph TRAD["传统Pipeline"]
direction TB
T1["传感器"]
T2["感知处理"]
T3["定位"]
T4["路径规划"]
T5["轨迹规划"]
T6["运动控制"]
T7["电机"]
T1 --> T2 --> T3 --> T4 --> T5 --> T6 --> T7
end
subgraph E2E["端到端"]
direction TB
E1["传感器数据"]
E2["神经网络"]
E3["电机"]
E1 --> E2 --> E3
end
style TRAD fill:#E3F2FD,stroke:#1976D2
style E2E fill:#F3E5F5,stroke:#7B1FA2,stroke-width:3px
3.2 端到端替代范围
端到端并不是万能替代。在低层运动控制场景,神经网络可以接管规划与控制;但在高层任务中,感知和定位往往仍需要保留,以保证对环境的可靠理解。
flowchart TB
subgraph FULL["传统Pipeline完整流程"]
direction TB
F1["传感器"]
F2["感知"]
F3["定位"]
F4["地图"]
F5["规划"]
F6["控制"]
F7["电机"]
F1 --> F2 --> F3 --> F4 --> F5 --> F6 --> F7
end
subgraph PART["端到端替代范围"]
direction TB
P1["传感器"]
P2["感知"]
P3["定位"]
P4["地图"]
P5["神经网络"]
P6["电机"]
P1 --> P2 --> P3 --> P4 --> P5 --> P6
end
style FULL fill:#E3F2FD,stroke:#1976D2
style PART fill:#FFF8E1,stroke:#F57C00
style P5 fill:#F3E5F5,stroke:#7B1FA2,stroke-width:5px
端到端替代的核心是规划与控制环节,感知和定位在很多场景仍需要保留。
3.3 不同层级的端到端适用场景
低层运动(走路、平衡)只需本体感知信号,不需要地图;高层任务(导航、抓取)依赖视觉与定位,神经网络只接管动作生成。
flowchart TB
subgraph L1["场景A 低层运动"]
direction TB
L1_I1["关节角度"]
L1_I2["IMU"]
L1_I3["触地传感器"]
L1_NN["神经网络"]
L1_O["关节力矩"]
L1_I1 --> L1_NN
L1_I2 --> L1_NN
L1_I3 --> L1_NN
L1_NN --> L1_O
end
subgraph L2["场景B 高层任务"]
direction TB
L2_I1["视觉"]
L2_LOC["定位"]
L2_NN["神经网络"]
L2_O["动作"]
L2_I1 --> L2_LOC --> L2_NN --> L2_O
end
style L1 fill:#E8F5E9,stroke:#388E3C
style L2 fill:#F3E5F5,stroke:#7B1FA2
四、端到端策略网络从训练到部署全流程
端到端不是黑盒魔法,而是清晰的工程流程:定义观测空间、定义动作空间、设计奖励、训练循环、导出部署。每一步都有明确的工程产物。
4.1 完整训练流程
flowchart TB
A(["🔴 开始"])
subgraph P1["定义观测空间"]
direction TB
O1["obs 关节角+IMU"]
end
subgraph P2["定义动作空间"]
direction TB
A1["action 关节力矩"]
end
subgraph P3["设计奖励"]
direction TB
R1["前进+1 能耗-0.1<br/>摔倒-10"]
end
subgraph P4["训练循环"]
direction TB
TRAIN["policy→action<br/>→env→reward→update"]
end
subgraph P5["导出部署"]
direction TB
EXPORT["pt→ONNX<br/>→ONNX Runtime"]
end
Z(["✅ 真机运行"])
A --> P1
P1 --> P2
P2 --> P3
P3 --> P4
P4 --> P5
P5 --> Z
style A fill:#E8F5E9,stroke:#388E3C
style P1 fill:#E3F2FD,stroke:#1976D2
style P2 fill:#E3F2FD,stroke:#1976D2
style P3 fill:#E3F2FD,stroke:#1976D2
style P4 fill:#F3E5F5,stroke:#7B1FA2
style P5 fill:#E8F5E9,stroke:#388E3C
style Z fill:#E8F5E9,stroke:#388E3C
4.2 端到端策略网络代码
端到端 Policy 网络结构本身很简洁:输入观测向量,经过若干全连接层,输出关节动作。训练好的网络导出为 ONNX,部署到机器人本体。
class Policy(torch.nn.Module):
def __init__(self):
super().__init__()
self.net = torch.nn.Sequential(
torch.nn.Linear(48, 256), # 输入层
torch.nn.ReLU(),
torch.nn.Linear(256, 256), # 隐藏层
torch.nn.ReLU(),
torch.nn.Linear(256, 12), # 输出层
)
def forward(self, obs):
return self.net(obs)
# 推理部署
obs = get_sensors() # 传感器读数
action = policy(obs) # 神经网络前向
motor.send(action) # 直接发命令
4.3 模块化与端到端代码量对比
flowchart TB
subgraph MOD["模块化代码"]
direction TB
M1["障碍物=yolo(image)"]
M2["位置=amcl(scan,map)"]
M3["路径=a_star(pos,goal)"]
M4["速度=dwa(path)"]
M5["motor.send(vel)"]
end
subgraph E2E_C["端到端代码"]
direction TB
E1["obs=get_sensors()"]
E2["action=policy(obs)"]
E3["motor.send(action)"]
end
style MOD fill:#E3F2FD,stroke:#1976D2
style E2E_C fill:#F3E5F5,stroke:#7B1FA2
| 对比 |
模块化 |
端到端 |
| 代码量 |
多 |
少 |
| 可调试性 |
高 |
低 |
| 泛化能力 |
弱 |
强 |
| 计算量 |
小 |
大 |
五、MLP到Diffusion模型架构分类与选型
端到端策略网络的 backbone 选型,决定了机器人能处理的任务复杂度。从最简单的 MLP,到能处理图像的 CNN+MLP,再到能理解语言的 Transformer,以及生成式动作的 Diffusion,模型能力逐步跃迁。
来自 linuxros.cn · linuxROS
5.1 模型架构分类
flowchart TB
subgraph M1["MLP 多层感知机"]
direction TB
M1_1["Linear→ReLU→输出"]
M1_2["简单快速够用"]
end
subgraph M2["CNN+MLP 视觉控制"]
direction TB
M2_1["图像→CNN→MLP→动作"]
M2_2["能处理图像"]
end
subgraph M3["Transformer 全局感知"]
direction TB
M3_1["图像+语言→ViT→动作"]
M3_2["理解语言泛化强"]
end
subgraph M4["Diffusion 生成式动作"]
direction TB
M4_1["观测→噪声→去噪轨迹"]
M4_2["动作多样可生成"]
end
style M1 fill:#E8F5E9,stroke:#388E3C
style M2 fill:#E3F2FD,stroke:#1976D2
style M3 fill:#F3E5F5,stroke:#7B1FA2
style M4 fill:#FFF8E1,stroke:#F57C00
5.2 模型选择指南
| 任务 |
推荐模型 |
原因 |
| 四足走路 |
MLP |
够用、延迟低 |
| 视觉导航 |
CNN+MLP |
端到端图像 |
| 复杂操作 |
Transformer |
全局感知 |
| 通用机器人 |
VLA |
语言+视觉+动作 |
5.3 主流RL算法与网络架构
flowchart TB
subgraph RL["强化学习算法"]
direction TB
PPO["PPO<br/>稳定常用"]
AMP["AMP<br/>动作自然"]
WMP["WMP<br/>全身协调"]
SAC["SAC<br/>探索性强"]
end
subgraph ARCH["网络架构"]
direction TB
NET_MLP["MLP<br/>全连接"]
NET_CNN["CNN<br/>卷积"]
NET_TR["Transformer<br/>注意力"]
end
RL --> ARCH
style PPO fill:#E8F5E9,stroke:#388E3C
style AMP fill:#F3E5F5,stroke:#7B1FA2
style WMP fill:#FFF8E1,stroke:#F57C00
style SAC fill:#E3F2FD,stroke:#1976D2
style NET_MLP fill:#E3F2FD,stroke:#1976D2
style NET_CNN fill:#E3F2FD,stroke:#1976D2
style NET_TR fill:#F3E5F5,stroke:#7B1FA2
| 算法 |
全称 |
特点 |
适用场景 |
| PPO |
Proximal Policy Optimization |
稳定、常用 |
几乎所有机器人 |
| AMP |
Adversarial Motion Prior |
动作自然 |
四足人形运动 |
| WMP |
Whole-Body Motion Prior |
全身协调 |
人形机器人 |
| SAC |
Soft Actor-Critic |
探索性强 |
复杂任务 |
六、视觉基础模型赋能机器人感知能力
具身智能的爆发离不开视觉基础模型。CLIP、DINOv2、SAM 2、Grounding-DINO 提供了通用的感知底座,Depth Anything 给出稠密深度,FoundationPose 追踪物体姿态,RDT-1B 直接生成双臂动作。
6.1 视觉基础模型总览
flowchart TB
subgraph PERCEPT["感知层"]
direction TB
CLIP["CLIP<br/>图文相似度"]
DINO["DINOv2<br/>视觉特征"]
SAM["SAM 2<br/>图像分割"]
GROUND["Grounding-DINO<br/>目标检测"]
end
subgraph DEPTH["深度估计"]
direction TB
DEPTH_N["Depth Anything<br/>单目深度"]
end
subgraph POSE["姿态追踪"]
direction TB
POSE_N["FoundationPose<br/>6DoF追踪"]
end
subgraph GEN["生成模型"]
direction TB
SD["Stable Diffusion<br/>图像生成"]
RDT["RDT-1B<br/>双臂操作"]
end
PERCEPT --> DEPTH
PERCEPT --> POSE
PERCEPT --> GEN
style CLIP fill:#E3F2FD,stroke:#1976D2
style DINO fill:#E3F2FD,stroke:#1976D2
style SAM fill:#F3E5F5,stroke:#7B1FA2
style GROUND fill:#FFF8E1,stroke:#F57C00
style DEPTH_N fill:#E8F5E9,stroke:#388E3C
style POSE_N fill:#E8F5E9,stroke:#388E3C
style SD fill:#FFEBEE,stroke:#D32F2F
style RDT fill:#F3E5F5,stroke:#7B1FA2
6.2 视觉基础模型对比
| 模型 |
机构 |
能力 |
具身应用 |
| CLIP |
OpenAI |
图文相似度 |
开放词汇感知 |
| DINOv2 |
Meta |
高层视觉特征 |
跨图像对应 |
| SAM 2 |
Meta |
图像分割 |
场景理解 |
| Grounding-DINO |
IDEA |
开放词汇检测 |
目标定位 |
| Depth Anything |
港大/字节 |
单目深度估计 |
稠密重建 |
| FoundationPose |
NVIDIA |
6DoF姿态追踪 |
物体操作 |
| RDT-1B |
清华 |
双臂操作 |
通用操作 |
6.3 视觉模型在机器人中的使用方式
视觉基础模型在机器人中通常以"编码器—融合—解码器"的三段式结构出现。图像经过 ViT 编码,语言指令经过 LLM 编码,两路特征在跨模态融合层对齐,再由解码器输出动作、导航或操作指令。
flowchart TB
subgraph INPUT["输入"]
direction TB
IMG["相机图像"]
TXT["语言指令"]
end
subgraph ENCODE["编码器"]
direction TB
VIT["ViT编码器"]
LLM["LLM编码器"]
end
subgraph FUSION["特征融合"]
direction TB
FUS["跨模态融合"]
end
subgraph DECODE["解码器"]
direction TB
ACT["动作解码"]
NAV["导航解码"]
MANI["操作解码"]
end
IMG --> VIT
TXT --> LLM
VIT --> FUS
LLM --> FUS
FUS --> DECODE
style INPUT fill:#E3F2FD,stroke:#1976D2
style ENCODE fill:#FFF8E1,stroke:#F57C00
style FUSION fill:#F3E5F5,stroke:#7B1FA2
style DECODE fill:#E8F5E9,stroke:#388E3C
七、强化学习算法与Sim2Real训练实践
RL 是机器人端到端训练的主力工具。算法层面分 On-Policy 与 Off-Policy 两大类,工程层面则依赖 Isaac Lab、Mujoco、SAPIEN 等仿真平台完成 Sim2Real 迁移。
7.1 RL算法分类
flowchart TB
subgraph RL_TYPE["强化学习分类"]
direction TB
ON["On-Policy<br/>PPO/TRPO"]
OFF["Off-Policy<br/>SAC/TD3/DDPG"]
end
subgraph RL_ALGO["主流算法"]
direction TB
PPO_L["PPO<br/>稳定采样效率高"]
SAC_L["SAC<br/>连续动作探索强"]
AMP_L["AMP<br/>动作先验自然"]
WMP_L["WMP<br/>全身协调"]
end
RL_TYPE --> RL_ALGO
style ON fill:#E3F2FD,stroke:#1976D2
style OFF fill:#F3E5F5,stroke:#7B1FA2
style PPO_L fill:#E8F5E9,stroke:#388E3C
style SAC_L fill:#FFF8E1,stroke:#F57C00
style AMP_L fill:#F3E5F5,stroke:#7B1FA2
style WMP_L fill:#FFEBEE,stroke:#D32F2F
7.2 PPO算法核心原理
PPO 是机器人 RL 的事实标准。它通过 Clip 损失限制策略更新幅度,配合 GAE 优势估计,兼顾稳定性与样本效率。训练好的策略可导出 ONNX,在真机上用 ONNX Runtime 推理。
flowchart TB
A(["🔴 开始训练"])
subgraph COLLECT["数据采集"]
direction TB
POL["当前策略"]
ENV["环境"]
BUF["经验缓冲"]
end
subgraph TRAIN["策略更新"]
direction TB
CLIP["PPO Clip损失"]
ADV["GAE优势估计"]
GRAD["梯度更新"]
end
subgraph DEPLOY["部署"]
direction TB
ONNX["ONNX导出"]
RT["ONNX Runtime"]
end
Z(["✅ 真机运行"])
A --> POL
POL -->|"action"| ENV
ENV -->|"reward/obs"| BUF
BUF -->|"batch"| TRAIN
TRAIN -->|"新策略"| POL
POL -->|"导出"| ONNX
ONNX --> RT
RT --> Z
style A fill:#E8F5E9,stroke:#388E3C
style COLLECT fill:#E3F2FD,stroke:#1976D2
style TRAIN fill:#F3E5F5,stroke:#7B1FA2
style DEPLOY fill:#E8F5E9,stroke:#388E3C
style Z fill:#E8F5E9,stroke:#388E3C
7.3 Sim2Real训练流程
Sim2Real 的核心思路是在仿真中训练,在仿真中验证,再迁移到真机。验证不通过则回到训练循环调整,避免直接在真机上试错带来的硬件损耗。
flowchart TB
A(["🔴 启动训练"])
subgraph SIM["仿真训练"]
direction TB
IG["Isaac Lab/Mujoco"]
URDF["URDF模型"]
CONFIG["环境配置"]
end
subgraph RL_TRAIN["RL训练"]
direction TB
OBS["观测空间"]
NET["Policy网络"]
ACT["动作输出"]
REW["奖励函数"]
end
subgraph VERIFY["Sim2Sim验证"]
direction TB
SIM2["Mujoco/SAPIEN"]
PASS{"验证通过?"}
end
subgraph DEPLOY["真机部署"]
direction TB
RT["ONNX Runtime"]
CAN["CAN总线"]
MOTOR["关节电机"]
end
Z(["✅ 真机稳定运行"])
A --> SIM
SIM --> RL_TRAIN
RL_TRAIN -->|"导出"| VERIFY
VERIFY -->|"是"| DEPLOY
VERIFY -.->|"否"| RL_TRAIN
DEPLOY --> Z
style A fill:#E8F5E9,stroke:#388E3C
style SIM fill:#E3F2FD,stroke:#1976D2
style RL_TRAIN fill:#F3E5F5,stroke:#7B1FA2
style VERIFY fill:#FFF8E1,stroke:#F57C00
style DEPLOY fill:#E8F5E9,stroke:#388E3C
style Z fill:#E8F5E9,stroke:#388E3C
7.4 主流仿真平台对比
| 仿真平台 |
核心特点 |
主要优势 |
适用场景 |
| Isaac Lab |
NVIDIA Isaac Sim 统一 RL 框架 |
整合 Isaac Gym + ROS2 + USD |
传感器仿真+RL全流程 |
| Mujoco |
DeepMind 维护的通用物理引擎 |
跨平台、接触建模优秀 |
机械臂操作、学术研究 |
| SAPIEN |
斯坦福+UCSD开发 |
物体交互仿真业界最佳 |
精细抓取、铰接推理 |
| Genesis |
CMU 开源多后端平台 |
多物理引擎后端可切换 |
快速原型、轻量RL |
八、模仿学习与VLA基础模型前沿探索
RL 解决"无师自通"的问题,模仿学习解决"照着做"的问题。VLA 模型则进一步把视觉、语言、动作统一到一个网络里,是当前通用机器人基础模型的主流范式。
8.1 模仿学习分类
模仿学习的核心是利用人类演示数据训练策略。BC 直接复制演示,GAIL 通过对抗生成模仿,DALLE 类方法则借助数据增强提升泛化。数据来源主要是遥操作示教和视频演示。
flowchart TB
A(["🔴 人类演示"])
subgraph DEMO["数据来源"]
direction TB
TELE["遥操作示教"]
VIDEO["视频演示"]
end
subgraph IL["模仿学习"]
direction TB
BC["行为克隆BC"]
GAIL["GAIL对抗生成"]
DALLE_N["数据增强模仿"]
end
subgraph DEPLOY_IL["部署"]
direction TB
POLICY_IL["策略网络"]
REAL["真机执行"]
end
Z(["✅ 任务完成"])
A --> DEMO
DEMO --> BC
BC --> POLICY_IL
POLICY_IL --> REAL
REAL --> Z
style A fill:#E8F5E9,stroke:#388E3C
style IL fill:#F3E5F5,stroke:#7B1FA2
style DEMO fill:#E3F2FD,stroke:#1976D2
style DEPLOY_IL fill:#E8F5E9,stroke:#388E3C
style Z fill:#E8F5E9,stroke:#388E3C
8.2 VLA模型架构
VLA(Vision-Language-Action)把视觉编码、语言理解、动作生成统一到一个 Transformer 之中。RT-2、OpenVLA、Octo、π0、RDT-1B 是当前主流的开源或半开源 VLA 模型。
flowchart TB
subgraph INPUT_VLA["VLA输入"]
direction TB
IMG["图像<br/>摄像头"]
TXT["语言指令<br/>把杯子放桌上"]
end
subgraph CORE_VLA["VLA核心"]
direction TB
VIT["ViT编码器"]
LLM["LLM编码器"]
DEC["动作解码器"]
end
subgraph OUTPUT_VLA["VLA输出"]
direction TB
ACT["关节动作序列"]
end
IMG --> VIT
TXT --> LLM
VIT --> DEC
LLM --> DEC
DEC --> ACT
style INPUT_VLA fill:#E3F2FD,stroke:#1976D2
style CORE_VLA fill:#F3E5F5,stroke:#7B1FA2,stroke-width:3px
style OUTPUT_VLA fill:#E8F5E9,stroke:#388E3C
| VLA模型 |
机构 |
参数 |
特点 |
| RT-2 |
Google DeepMind |
55B |
视觉语言动作统一 |
| RDT-1B |
清华 |
1B |
双臂操作few-shot |
| OpenVLA |
开源社区 |
7B |
通用操作开放权重 |
| Octo |
Berkeley |
93M |
通用机器人策略 |
| π0 |
Physical Intelligence |
- |
通用机器人基础模型 |
8.3 世界模型概念
当前端到端策略本质是黑盒映射,缺乏对物理规律的理解。世界模型的目标是让机器人能预测行动后果,理解重力、摩擦、碰撞,从而在"脑内"模拟再行动。
flowchart TB
subgraph NOW["现在 黑盒神经网络"]
direction TB
N1["输入 状态+动作"]
N2["输出 下一状态"]
N3["不懂物理定律"]
end
subgraph FUTURE["未来 世界模型"]
direction TB
F1["输入 状态+动作"]
F2["输出 预测下一状态"]
F3["理解重力摩擦"]
end
style NOW fill:#FFEBEE,stroke:#D32F2F
style FUTURE fill:#E8F5E9,stroke:#388E3C
| 当前问题 |
世界模型解决 |
| 神经网络黑盒 |
能预测行动后果 |
| 试错成本高 |
脑内模拟再行动 |
| 泛化差 |
理解物理能泛化 |
九、机器人技术未来发展路线与突破点
机器人端到端技术仍在快速演进。短期内视觉动作端到端与基础模型应用会率先落地,远期则需要世界模型、持续学习、通用性等底层突破。
9.1 未来发展路线图
flowchart LR
subgraph NOW["现在 2024-2025"]
direction TB
N1["四足运动端到端"]
N2["VLA开始实用"]
N3["Sim2Real改进中"]
end
subgraph SOON["近期 2025-2026"]
direction TB
S1["手臂腿协调"]
S2["视觉动作端到端"]
S3["基础模型应用"]
end
subgraph FAR["远期 2027+"]
direction TB
F1["世界模型应用"]
F2["持续学习"]
F3["通用人形机器人"]
end
NOW --> SOON --> FAR
style NOW fill:#E3F2FD,stroke:#1976D2
style SOON fill:#FFF8E1,stroke:#F57C00
style FAR fill:#E8F5E9,stroke:#388E3C
9.2 未来最大突破点
flowchart TB
subgraph BREAK["未来突破点"]
direction TB
B1["物理世界理解<br/>让机器人懂物理"]
B2["样本效率<br/>几十样本学新任务"]
B3["实时性<br/>1ms推理更丝滑"]
B4["安全性<br/>有保障的自主学习"]
B5["通用性<br/>一个模型做所有事"]
end
style B1 fill:#F3E5F5,stroke:#7B1FA2
style B2 fill:#FFF8E1,stroke:#F57C00
style B3 fill:#E3F2FD,stroke:#1976D2
style B4 fill:#E8F5E9,stroke:#388E3C
style B5 fill:#FFEBEE,stroke:#D32F2F
十、典型机器人案例端到端架构剖析
把前面讲过的架构落到具体案例上,可以更直观看到端到端在不同形态机器人上的应用差异。宇树 Go2 用 MLP 走路,AgiBot X1 用 WMP 协调全身,RT-2 则用 55B VLA 处理通用任务。
10.1 三类代表机器人架构对比
flowchart TB
subgraph G["宇树Go2 四足"]
direction TB
G_I["输入 关节+IMU+目标速度"]
G_N["MLP 3层全连接"]
G_O["输出 12关节力矩"]
G_T["训练 Isaac Lab+PPO"]
G_I --> G_N --> G_O
end
subgraph A["AgiBot X1 人形"]
direction TB
A_I["输入 本体感知+接触力"]
A_N["MLP/Transformer"]
A_O["输出 全身关节力矩"]
A_T["训练 Isaac Lab+PPO+WMP"]
A_I --> A_N --> A_O
end
subgraph R["RT-2 通用机器人"]
direction TB
R_I["输入 图像+语言指令"]
R_N["55B VLA模型"]
R_O["输出 动作序列"]
R_T["训练 互联网规模数据"]
R_I --> R_N --> R_O
end
style G fill:#E8F5E9,stroke:#388E3C
style A fill:#F3E5F5,stroke:#7B1FA2
style R fill:#FFF8E1,stroke:#F57C00
style G_N fill:#F3E5F5,stroke:#7B1FA2
style A_N fill:#F3E5F5,stroke:#7B1FA2
style R_N fill:#F3E5F5,stroke:#7B1FA2,stroke-width:3px
| 案例 |
形态 |
网络架构 |
训练方法 |
| 宇树Go2 |
四足 |
MLP |
Isaac Lab + PPO |
| AgiBot X1 |
人形 |
MLP/Transformer |
Isaac Lab + PPO + WMP |
| RT-2 |
通用 |
55B VLA |
互联网规模数据 |
十一、架构选型与核心公式通俗总结
把全文要点浓缩成几句话与几个公式,方便回顾。强化学习是替代控制器,端到端不等于不用感知定位,未来的方向是 VLA + 世界模型 + 持续学习。
11.1 一句话理解核心概念
| 概念 |
一句话 |
| 强化学习 |
像训练小狗,做对了奖励做错了惩罚 |
| 端到端 |
一个模型搞定感知到控制 |
| MLP |
条件反射,简单直接 |
| Transformer |
有大脑,能思考全局 |
| VLA |
看视频学动作,听懂指令 |
| 世界模型 |
理解物理,像人一样思考后果 |
11.2 架构选择决策
| 场景 |
推荐架构 |
| 工业机械臂精准定位 |
传统Pipeline |
| 四足复杂地形行走 |
端到端RL |
| 人形全身协调 |
混合架构 |
| 通用任务机器人 |
VLA |
11.3 核心公式
端到端RL = 替代"控制器"
= 强化学习算法 + 神经网络架构
≠ 不用定位/感知(低层运动可以)
未来 = VLA(视觉-语言-动作) + 世界模型 + 持续学习
参考开源项目
- ROS2 机器人操作系统模块化框架
- OpenVLA 开源视觉-语言-动作模型
- Octo 通用机器人策略模型
- Isaac Lab NVIDIA 统一 RL 仿真框架
- RDT-1B 清华双臂操作基础模型
- FoundationPose NVIDIA 6DoF 姿态追踪
- Embodied-AI-Guide 具身智能技术指南
- rsl_rl ANYbotics 快速强化学习库
- Agibot X1 AimRT 端到端推理项目