Robotics Knowledge Base
机器人模型架构知识库 —— 按主题分类,共 19 篇文档。
VLA 模型14
视觉-语言-动作 (Vision-Language-Action) 模型架构
Pi0
Pi0 是 Physical Intelligence 提出的视觉-语言-动作 (VLA) 模型,采用 PaliGemma (SigLIP + Gemma 2B) 作为视觉语言主干网络,配合独立的 Gemma 300M Action Expert 进行动作生成。其核心创新在于 双流 Transformer 注意力机制——VLM 前缀序列与动作专家后缀序列共享同一组 Tran...
Pi0.5
Pi0.5 (Physical Intelligence 0.5) 是 Physical Intelligence 推出的视觉-语言-动作 (VLA) 模型,在架构上与 Pi0 几乎完全相同,均采用 PaliGemma 视觉语言模型作为感知主干、Gemma 300M 作为动作专家 (Action Expert),通过双流 Transformer 实现视觉语言特征与动作特征的联合处理,并使用 Flo...
Pi0-FAST
Pi0-FAST (Fast Action Sequence Tokenizer) 是 Physical Intelligence 提出的一种高效视觉-语言-动作 (VLA) 模型。与 Pi0 使用 Flow Matching 扩散生成连续动作不同,Pi0-FAST 将连续动作离散化为 token,然后通过 PaliGemma 视觉语言模型进行 自回归 next-token 预测。...
π*₀.₆ (Pi-Star-0.6)
π*₀.₆ 是 Physical Intelligence 2025 年 11 月发布的 VLA(arXiv:2511.14759),核心不是新的网络主干,而是一种让 VLA 通过真实世界部署反复改进的训练方法 —— RECAP(RL with Experience and Corrections via Advantage-conditioned P...
π₀.₇ (Pi-0.7)
π₀.₇ 是 Physical Intelligence 2026 年 4 月发布的 VLA(arXiv:2604.15483),定位为 "steerable generalist robotic foundation model"。它最大的卖点不在新主干,而是在 prompt 里塞进了多模态 context conditioning:除了语言指令,还给模型喂 episode me...
Isaac-GR00T N1.6
Isaac GR00T N1.6 是 NVIDIA 提出的视觉-语言-动作 (VLA) 通用人形机器人基座模型,3B 参数级。其架构由两部分串联:上游 Eagle Vision-Language Backbone(基于 NVIDIA Cosmos-Reason-2B VLM 变体)将图像 + 语言编码成统一的多模态特征序列;下游 Action Head 使用 32 层 Alte...
Isaac-GR00T N1.5
Isaac GR00T N1.5 是 NVIDIA 发布的首个公开 VLA 基座模型(3B 参数)。架构由两段组成:Eagle 2 VLM Backbone(冻结)→ 4 层 transformer adapter → 16 层 DiT + Flow Matching 出动作 chunk。多 embodiment 支持通过 CategorySpecificMLP 实现,最多 3...
ACT
ACT (Action Chunking Transformer) 是一种基于 Transformer 编码器-解码器结构的机器人操作策略模型,出自论文 Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (Zhao et al., 2023)。其核心思想是 动作分块 (Action Chunking):...
SmolVLA
SmolVLA (Small Vision-Language-Action) 是由 Hugging Face 设计的轻量级视觉-语言-动作 (VLA) 模型,采用 SmolVLM2-500M-Video-Instruct 作为视觉语言主干网络,并引入独立的 Action Expert 网络通过交叉注意力机制从 VLM 中提取特征来生成机器人动作。SmolVLA 使用 Flow ...
WALL-OSS / WALL-X
WALL-OSS (WALL-X) 是一个跨具身的 视觉-语言-动作 (VLA) 模型,以 Qwen2.5-VL + 混合专家 (MoE) 作为视觉语言骨干网络,结合 Flow Matching 动作头 进行机器人连续动作预测。与 GR00T N1.5 等模型不同,WALL-X 采用当前最强的 VLM (Qwen2.5-VL) 作为骨干,通过 3D RoPE 位置编码对图像...
X-VLA
X-VLA (Extended Vision-Language-Action) 是一个基于扩散的跨具身视觉-语言-动作模型,将 Florence2 视觉语言模型作为感知主干网络,配合软提示 Transformer (SoftPromptedTransformer) 动作头进行机器人动作预测。其核心设计思路为:Florence2 的 Vision Tower 和 BART 编码器提取多模态特征(...
Psi0 (ψ₀)
Ψ₀ 是 USC PSI Lab 面向人形机器人全身 loco-manipulation 的开源基础模型(RSS 2026,arXiv:2603.12263,CVPR 2026 第二届 3D-LLM/VLA Workshop 最佳论文)。它的核心主张不是某个新模块,而是一条数据配方:"scaling the right data in the right way" —— 先用大...
DreamZero
DreamZero 是一个世界动作模型 (World Action Model, WAM),通过联合预测未来视频帧与机器人动作序列,实现对未见任务的零样本泛化。其核心创新在于:基于 Wan2.1 视频扩散模型构建 Causal WAN DiT,以 Flow Matching 框架在视频 latent 空间和动作空间上同步去噪,配合多机器人体 Category-specific MLP 支持...
Fast-WAM
Fast-WAM 是一个世界动作模型 (World Action Model, WAM),论文标题本身就是它要回答的问题:"Do World Action Models Need Test-time Future Imagination?"(arXiv:2603.16666)。结论是不需要 —— 现有 WAM(如 DreamZero、IDM 类方法)在推理时要先把未来视频去噪生...
全身控制 (WBC)4
人形机器人全身控制与运动生成
GR00T-WBC 总览
GR00T-WholeBodyControl 是 NVIDIA GEAR 团队的人形机器人全身控制代码库,目标平台是 Unitree G1(29 DoF,带灵巧手时 43 DoF)。它不是一个单一模型,而是三条并列的技术路线外加一套共享的部署/遥操作基础设施:
Decoupled WBC
Decoupled WBC 是 GR00T-WholeBodyControl 里最保守也最好调试的一条全身控制路线:它不训练一个端到端的全身策略,而是把机器人从腰部劈成两半 —— 下半身交给强化学习(ONNX 策略,50 Hz 闭环),上半身交给逆运动学(QP-IK + 插值,开环跟随遥操作目标)。
MotionBricks
MotionBricks(arXiv:2604.24833,Tingwu Wang 等,2026)是 GR00T-WholeBodyControl 里的运动生成层 —— 它不控制机器人,它生产机器人要跟踪的运动。给定几帧上下文和一个方向/风格指令,它在毫秒级内合成一段物理合理的 G1 全身运动,吞吐达到 15,000 FPS 的零样本合成速度。
3D 视觉与 VLM1
空间理解、深度、位姿与视觉语言模型
VLM³
VLM³ 的论点非常直接,也非常反直觉: