ESC
输入关键词搜索文章标题和内容

机器人视觉模型从CLIP到VLA进化路径全景

本文由 linuxROS 整理发布,首发于 linuxros.cn,转载请注明出处。

机器人视觉模型从CLIP到VLA进化路径全景

导读:机器人"眼睛"背后是一条完整的视觉模型链——CLIP认出物体、SAM画出轮廓、Depth Anything量出距离、FoundationPose盯住位姿、VLA把"看+听+说"直接变成关节动作。本文用两张图串起这条技术链,看懂机器人怎么从"看见"走到"行动"。


一、视觉基础模型识别分割测距各司其职

视觉模型是具身智能的感官底座,不需要从零训练,拿开源模型直接赋能下游任务。识别、分割、深度、姿态四个层级形成完整感知链,每一层解决一个独立问题。

flowchart TB Start(["🔴 输入图像"]) subgraph RECOG["识别层"] direction TB CLIP["CLIP图文相似度"] DINO["DINOv2视觉特征"] GND["Grounding-DINO检测"] end subgraph SEG["分割层"] direction TB SAM["SAM2分割掩码"] end subgraph DEPTH["深度层"] direction TB DA["Depth Anything深度"] end subgraph POSE["姿态层"] direction TB FP["FoundationPose位姿"] end End(["✅ 6DoF位姿输出"]) Start --> RECOG RECOG --> SEG SEG --> DEPTH DEPTH --> POSE POSE --> End style Start fill:#FFEBEE,stroke:#C62828 style RECOG fill:#E3F2FD,stroke:#1976D2 style SEG fill:#F3E5F5,stroke:#7B1FA2 style DEPTH fill:#FFF8E1,stroke:#F57C00 style POSE fill:#E8F5E9,stroke:#388E3C style End fill:#E8F5E9,stroke:#388E3C style CLIP fill:#BBDEFB style DINO fill:#BBDEFB style GND fill:#BBDEFB style SAM fill:#F3E5F5 style DA fill:#FFECB3 style FP fill:#C8E6C9

七大模型速查表

模型 机构 输入 → 输出 具身应用
CLIP OpenAI 图像+文字 → 相似度 开放词汇感知
DINOv2 Meta 图像 → 特征向量 跨图语义对应
Grounding-DINO IDEA 图像+词 → 检测框 目标定位
SAM 2 Meta 图像+点 → 分割掩码 场景分割
Depth Anything V2 港大 RGB图 → 深度图 稠密建图
FoundationPose NVIDIA RGB-D+模型 → 6DoF 物体抓取
RDT-1B 清华 图像+状态 → 动作 双臂操作

CLIP用对比学习把图像和文字投影到同一向量空间,让机器人理解"这是杯子"这类开放词汇。SAM 2在Meta新一代架构中加入视频时序建模,能分割连续帧中的同一物体。Depth Anything V2基于大规模伪标签蒸馏,单张RGB图就能输出像素级深度。FoundationPose把单帧位姿估计和跟踪统一到一个框架,机械臂抓取时无需重新初始化。


二、VLA把视觉语言融合成动作指令

前面四个层级各自解决"看"的问题,VLA(Vision-Language-Action)把"看+听+做"统一成一个模型。给机器人看画面加一句话,它直接输出关节动作序列,这就是具身智能的统一架构方向。

来自 linuxros.cn · linuxROS
flowchart TB Start(["🔴 输入信号"]) subgraph INPUT["输入"] direction TB IMG["相机图像"] TXT["语言指令"] end subgraph ENCODE["编码"] direction TB VIT["ViT视觉编码"] LLM["LLM语言编码"] end subgraph FUSION["融合"] direction TB CROSS["跨模态对齐"] end subgraph DECODE["解码"] direction TB ACT["动作解码器"] end End(["✅ 关节动作序列"]) Start --> INPUT IMG --> VIT TXT --> LLM VIT --> CROSS LLM --> CROSS CROSS --> ACT ACT --> End style Start fill:#FFEBEE,stroke:#C62828 style INPUT fill:#E3F2FD,stroke:#1976D2 style ENCODE fill:#FFF8E1,stroke:#F57C00 style FUSION fill:#F3E5F5,stroke:#7B1FA2 style DECODE fill:#E8F5E9,stroke:#388E3C style End fill:#E8F5E9,stroke:#388E3C style IMG fill:#BBDEFB style TXT fill:#BBDEFB style VIT fill:#FFECB3 style LLM fill:#FFECB3 style CROSS fill:#F3E5F5 style ACT fill:#C8E6C9

四大VLA模型对比

模型 机构 参数 输入 输出 特点
RT-2 Google DeepMind 55B 图像+语言 动作序列 互联网数据+机器人数据联合训练
RDT-1B 清华 1B 图像+本体状态 双臂动作 扩散Transformer,开源
OpenVLA Stanford等 7B 图像+语言 动作序列 完全开源,社区活跃
π0 Physical Intelligence - 多模态 通用动作 Flow Matching,通用基础模型

RT-2把PaLI-X大模型的视觉语言能力迁移到机器人动作空间,55B参数规模让其能消化互联网图文知识。RDT-1B用扩散Transformer建模双臂动作分布,1B参数就能在few-shot场景超越更大模型。OpenVLA基于Llama 2 7B加SigLIP+DinoV2双视觉编码器,完全开源可微调,社区贡献活跃。π0用Flow Matching替代传统扩散,是首个宣称通用的机器人基础模型。


三、技术链路总结与应用前景

机器人视觉的技术链可以这样串起来:

  1. 看懂:CLIP认出物体、SAM分割轮廓、Depth Anything测量距离
  2. 盯住:FoundationPose追踪物体位姿,给机械臂提供抓取坐标
  3. 会做:VLA模型把"看懂+听懂"直接变成关节动作

工业场景中视觉模型链已经成熟落地——3C装配用FoundationPose做精密抓取,仓储物流用CLIP+SAM做开放词汇拣选。VLA模型当前主要在科研场景验证,参数规模和推理延迟是落地的两大瓶颈。短期看视觉模型链加轻量策略模型是工程更稳的方案,长期看VLA统一架构是大方向。这条链的终极目标是让机器人听一句话就能行动,VLA正在让这个目标逐步变成现实。

参考来源(GitHub仓库简称)

  • CLIP — openai/CLIP
  • DINOv2 — facebookresearch/dinov2
  • SAM 2 — facebookresearch/sam2
  • Depth Anything V2 — DepthAnything/Depth-Anything-V2
  • FoundationPose — NVlabs/FoundationPose
  • RT-2 — google-research/rt-x
  • RDT-1B — thu-ml/RoboticsDiffusionTransformer
  • OpenVLA — openvla/openvla
  • π0 — Physical Intelligence 官方博客

版权声明

作者linuxROS
协议本作品采用 CC BY-NC-SA 4.0 许可协议:署名-非商业性使用-相同方式共享
关注欢迎关注微信公众号 linuxROS,获取更多机器人 / 嵌入式 / Linux 干货
返回首页