机器人视觉模型从CLIP到VLA进化路径全景
导读:机器人"眼睛"背后是一条完整的视觉模型链——CLIP认出物体、SAM画出轮廓、Depth Anything量出距离、FoundationPose盯住位姿、VLA把"看+听+说"直接变成关节动作。本文用两张图串起这条技术链,看懂机器人怎么从"看见"走到"行动"。
一、视觉基础模型识别分割测距各司其职
视觉模型是具身智能的感官底座,不需要从零训练,拿开源模型直接赋能下游任务。识别、分割、深度、姿态四个层级形成完整感知链,每一层解决一个独立问题。
七大模型速查表
| 模型 | 机构 | 输入 → 输出 | 具身应用 |
|---|---|---|---|
| CLIP | OpenAI | 图像+文字 → 相似度 | 开放词汇感知 |
| DINOv2 | Meta | 图像 → 特征向量 | 跨图语义对应 |
| Grounding-DINO | IDEA | 图像+词 → 检测框 | 目标定位 |
| SAM 2 | Meta | 图像+点 → 分割掩码 | 场景分割 |
| Depth Anything V2 | 港大 | RGB图 → 深度图 | 稠密建图 |
| FoundationPose | NVIDIA | RGB-D+模型 → 6DoF | 物体抓取 |
| RDT-1B | 清华 | 图像+状态 → 动作 | 双臂操作 |
CLIP用对比学习把图像和文字投影到同一向量空间,让机器人理解"这是杯子"这类开放词汇。SAM 2在Meta新一代架构中加入视频时序建模,能分割连续帧中的同一物体。Depth Anything V2基于大规模伪标签蒸馏,单张RGB图就能输出像素级深度。FoundationPose把单帧位姿估计和跟踪统一到一个框架,机械臂抓取时无需重新初始化。
二、VLA把视觉语言融合成动作指令
前面四个层级各自解决"看"的问题,VLA(Vision-Language-Action)把"看+听+做"统一成一个模型。给机器人看画面加一句话,它直接输出关节动作序列,这就是具身智能的统一架构方向。
四大VLA模型对比
| 模型 | 机构 | 参数 | 输入 | 输出 | 特点 |
|---|---|---|---|---|---|
| RT-2 | Google DeepMind | 55B | 图像+语言 | 动作序列 | 互联网数据+机器人数据联合训练 |
| RDT-1B | 清华 | 1B | 图像+本体状态 | 双臂动作 | 扩散Transformer,开源 |
| OpenVLA | Stanford等 | 7B | 图像+语言 | 动作序列 | 完全开源,社区活跃 |
| π0 | Physical Intelligence | - | 多模态 | 通用动作 | Flow Matching,通用基础模型 |
RT-2把PaLI-X大模型的视觉语言能力迁移到机器人动作空间,55B参数规模让其能消化互联网图文知识。RDT-1B用扩散Transformer建模双臂动作分布,1B参数就能在few-shot场景超越更大模型。OpenVLA基于Llama 2 7B加SigLIP+DinoV2双视觉编码器,完全开源可微调,社区贡献活跃。π0用Flow Matching替代传统扩散,是首个宣称通用的机器人基础模型。
三、技术链路总结与应用前景
机器人视觉的技术链可以这样串起来:
- 看懂:CLIP认出物体、SAM分割轮廓、Depth Anything测量距离
- 盯住:FoundationPose追踪物体位姿,给机械臂提供抓取坐标
- 会做:VLA模型把"看懂+听懂"直接变成关节动作
工业场景中视觉模型链已经成熟落地——3C装配用FoundationPose做精密抓取,仓储物流用CLIP+SAM做开放词汇拣选。VLA模型当前主要在科研场景验证,参数规模和推理延迟是落地的两大瓶颈。短期看视觉模型链加轻量策略模型是工程更稳的方案,长期看VLA统一架构是大方向。这条链的终极目标是让机器人听一句话就能行动,VLA正在让这个目标逐步变成现实。
参考来源(GitHub仓库简称)
- CLIP — openai/CLIP
- DINOv2 — facebookresearch/dinov2
- SAM 2 — facebookresearch/sam2
- Depth Anything V2 — DepthAnything/Depth-Anything-V2
- FoundationPose — NVlabs/FoundationPose
- RT-2 — google-research/rt-x
- RDT-1B — thu-ml/RoboticsDiffusionTransformer
- OpenVLA — openvla/openvla
- π0 — Physical Intelligence 官方博客