VLA 大脑—小脑分层控制架构:从视觉语言决策到机械臂抓取苹果并放入篮子的完整执行链路

发布时间:2026/8/28 8:08:56

VLA 大脑—小脑分层控制架构:从视觉语言决策到机械臂抓取苹果并放入篮子的完整执行链路
我会把“VLA 大脑 → 小脑 → 运动学/轨迹 → 伺服控制 → 电机/物理 → 反馈”拆成完整控制链,并用一组前后一致的 7 自由度单臂 + 平行夹爪示例数据贯穿“抓苹果放入篮子”。同时我会区分论文/开源实现里明确存在的接口,和工程上常见但并非 VLA 标准定义的“小脑”层。先给一个关键结论:论文里并没有统一定义一个名为“小脑(Cerebellum)”的模块。OpenVLA 这类系统常直接输出 7 维末端增量动作,再由机器人环境做坐标变换和 IK;而π0.5\pi_0.5π0​.5这类层级模型已经明确区分“高层子任务”和“低层动作专家”,这与“VLA 大脑 + 小脑”的工程抽象非常接近。工程上最值得注意的是“动作空间”。同一个 VLA 可能输出笛卡尔末端动作(Cartesian End-Effector Action),也可能输出关节动作(Joint-Space Action)。OpenVLA 的 OXE 配置明确支持“末端Δxyz\Delta xyzΔxyz+Δ\DeltaΔRPY + 夹爪”,而 Physical Intelligence 的 DROID 部署则使用“7 个关节速度 + 1 个夹爪量、15 Hz”。所以 IK 是否出现,取决于小脑最后输出在哪个空间。可以。下面我把它按一个真正可落地的分层具身控制(Hierarchical Embodied Control)系统拆开。先明确一个重要事实:业界并没有统一规定一个模块必须叫“小脑(Cerebellum)”。为了和你前面的“大脑 + 小脑 + IK”讨论保持一致,我采用下面这个工程定义:VLA大脑→高层子任务→小脑→连续动作→IK/控制器→机器人\boxed{\text{VLA 大脑}\rightarrow\text{高层子任务}\rightarrow\text{小脑}\rightarrow\text{连续动作}\rightarrow\text{IK/控制器}\rightarrow\text{机器人}}VLA大脑→高层子任务→小脑→连续动作→IK/控制器→机器人​这种划分与π0.5\pi_{0.5}π0.5​的论文结构尤其接近:它把高层推理写成“根据观测和总任务预测下一子任务”,再由动作专家根据该子任务预测低层动作序列。OpenVLA、RT-2 则证明了另一种路线:VLA 可以直接输出机器人低层动作。turn195172view0下面以一台类似 Franka Panda 的7 自由度机械臂(7-DoF Manipulator)+平行双指夹爪(Parallel-Jaw Gripper)为例,实现:“把桌子上的红苹果放进桌子上的篮子。”一、先看整个系统到底分成哪些层我建议实际系统按照下面这些层划分:层级模块核心作用典型输出L6VLA 大脑(VLA Brain)看懂场景、理解指令、决定下一子任务approach appleL5小脑(Cerebellum / Action Policy)把子任务变成短时连续动作末端动作 chunkL4动作适配器(Action Adapter)反归一化、坐标系转换、安全限幅Δx,ΔR,g\Delta x,\Delta R,gΔx,ΔR,gL3逆运动学(Inverse Kinematics, IK)末端动作变关节目标qdesq_{\mathrm{des}}qdes​L2关节伺服控制(Joint Servo Control)关节目标变力矩/速度/位置命令τ\tauτ或qcmdq_{\mathrm{cmd}}qcmd​L1驱动器(Actuator / Motor Driver)执行控制命令电机转矩L0机械系统(Robot Dynamics)真正产生运动qt+1,q˙t+1q_{t+1},\dot q_{t+1}qt+1​,q˙​t+1​Feedback传感器反馈(Sensor Feedback)RGB、关节、夹爪、力矩等新观测ot+1o_{t+1}ot+1​其中 OpenVLA 的官方 OXE 配置明确支持这种末端动作:at=[Δx,Δy,Δz,Δroll,Δpitch,Δyaw,g]a_t=[\Delta x,\Delta y,\Delta z,\Delta roll,\Delta pitch,\Delta yaw,g]at​=[Δx,Δy,Δz,Δroll,Δpitch,Δyaw,g]也就是 3 维平移 + 3 维旋转 + 1 维夹爪。二、先定义一个接近真实机械臂的场景为了下面所有数字能够串起来,先固定坐标系。这里定义机器人底座坐标系为:{ B}\{B\}{B}单位:位置:m角度:rad速度:m/s、rad/s力:N力矩:N·m场景如下。苹果苹果直径约:dapple=0.064md_{\mathrm{apple}}=0.064\text{ m}dapple​=0.064m苹果中心:papple=[0.480,0.140,0.033]p_{\mathrm{apple}}=[0.480,\ 0.140,\ 0.033]papple​=[0.480,0.140,0.033]也就是:机器人前方 48 cm左侧 14 cm苹果直径约 6.4 cm这个尺寸适合 8 cm 左右最大开口的双指夹爪。篮子篮子内部中心:pbasket=[0.530,−0.220,0.070]p_{\mathrm{basket}}=[0.530,\ -0.220,\ 0.070]pbasket​=[0.530,−0.220,0.070]篮口高度:zrim=0.125mz_{\mathrm{rim}}=0.125\text{ m}zrim​=0.125m内部有效尺寸约:240 mm × 180 mm因此苹果放入中心位置非常安全。机械臂初始状态7 个关节:q0=[0.100,−0.550,0.120,−2.050,0.050,1.630,0.780]q_0=[0.100,-0.550,0.120,-2.050,0.050,1.630,0.780]q0​=[0.100,−0.550,0.120,−2.050,0.050,1.630,0.780]单位 rad。关节速度:q˙0=[0.030,−0.010,0.020,0,0.010,−0.020,0.010]\dot q_0=[0.030,-0.010,0.020,0,0.010,-0.020,0.010]q˙​0​=[0.030,−0.010,0.020,0,0.010,−0.020,0.010]夹爪当前开口:w0=0.078mw_0=0.078\text{ m}w0​=0.078m当前末端大致位于:pee=[0.380,0.000,0.320]p_{ee}=[0.380,\ 0.000,\ 0.320]pee​=[0.380,0.000,0.320]末端朝下。下面这些数字是一组工程上合理的示例数据,不代表某一台 Franka 的实际标定记录;真实系统中的q↔TCPq\leftrightarrow TCPq↔TCP精确对应关系由 URDF、工具坐标和标定参数决定。三、VLA 大脑的输入到底是什么?这是最容易混淆的地方。不同 VLA 不完全相同。OpenVLA 的典型接口非常简单:image+language instruction ↓ predict_action()↓7-DoF action其官方示例就是 RGB 图像 + prompt,然后predict_action()输出机器人动作。而π0/π0.5\pi_0/\pi_{0.5}π0​/π0.5​更进一步,会显式输入机器人自身的本体感觉(Proprioception)。Physical Intelligence 的 DROID 适配代码实际构造的是:外部相机 RGB 腕部相机 RGB 7 个关节位置 1 个夹爪位置 语言 prompt其中代码明确将:joint_position: 7 + gripper_position: 1 = state: 8 dimensions拼接后输入模型。VLA 大脑输入示例例如当前时刻:instruction: "把桌子上的红苹果放进篮子。" base_rgb: dtype = uint8 shape = [224, 224, 3] wrist_rgb: dtype = uint8 shape = [224, 224, 3] joint_position: [ 0.100, -0.550, 0.120, -2.050, 0.050, 1.630, 0.780 ] gripper_position_normalized: [0.025]于是本体状态:qtVLA=[0.100,−0.550,0.120,−2.050,0.050,1.630,0.780,0.025]q_t^{VLA}=[0.100,-0.550,0.120,-2.050,0.050,1.630,0.780,0.025]qtVLA​=[0.100,−0.550,0.120,−2.050,0.050,1.630,0.780,0.025]OpenPI 的 DROID 实现同样使用外部相机和腕部相机,并将输入调整为224×224224\times224224×224。注意:VLA 实际收到的是图像,而不是:apple = [0.480, 0.140, 0.033] basket = [0.530, -0.220, 0.070]这些显式坐标通常不会直接提供给 VLA。VLA 是从图像里面“看出来”:红苹果在左前方,篮子在右前方。在仿真或者调试日志中,我们才可能同时知道物体的 ground truth 坐标。四、VLA 大脑的输出是什么?这里有两种业界主流方案。方案 A:VLA 直接输出动作RT-2 和 OpenVLA 更接近这种方式:It+l→atI_t+l\rightarrow a_tIt​+l→at​例如:输入: "把苹果放进篮子" + 当前 RGB 输出: [+0.008, +0.010, -0.012, 0, 0, 0, +1]这已经是低层机器人动作。RT-2 就是把机器人动作离散成 token,推理以后再反解成机器人动作,并执行闭环控制。五、更适合“大脑 + 小脑”的方案如果你明确想做:VLA 大脑 + 小脑那么更推荐π0.5\pi_{0.5}π0.5​风格的层级。论文中的观测可以写成:ot=[It1,…,ItN,qt]o_t=[I_t^1,\dots,I_t^N,q_t]ot​=[It1​,…,ItN​,qt​]其中包括:多路摄像头机器人状态总任务为:lll例如:put the red apple into the basket大脑先产生高层子任务:l^t\hat l_tl^t​然后动作专家产生动作:at:t+Ha_{t:t+H}at:t+H​论文实际上把这个关系写成:πθ(at:t+H,l^∣ot,l)=πθ(at:t+H∣ot,l^)πθ(l^∣ot,l)\pi_\theta(a_{t:t+H},\hat l\mid o_t,l)=\pi_\theta(a_{t:t+H}\mid o_t,\hat l)\pi_\theta(\hat l\mid o_t,l)

相关新闻

深入理解lambda与闭包:从《Let Over Lambda》学宏编程

深入理解lambda与闭包:从《Let Over Lambda》学宏编程

2026/8/28 8:08:56

之前在做 Web 后端时,总能看到 JDK 8 之后 Java 里大量出现lambda表达式,C 也在 C11 标准里引入了 lambda。时间久了,会想当然地认为 lambda 就是“匿名函数语法糖”。直到有人推荐我去读一本叫《Let Over Lambda》的英文书,我才意…

SAM2与UNet融合:高精度图像分割实战与调优指南

SAM2与UNet融合:高精度图像分割实战与调优指南

2026/8/28 7:58:56

简介:图像分割是计算机视觉的核心任务,旨在将图像划分为具有语义意义的区域。其原理通常基于编码器-解码器架构,编码器提取多层次特征,解码器恢复空间细节并输出像素级分类。这项技术的价值在于为自动驾驶、医疗影像分析、工业质检…

抖助手第059个开关:启用屏蔽广告的位置、验证方法与平台边界

抖助手第059个开关:启用屏蔽广告的位置、验证方法与平台边界

2026/8/28 7:58:56

🔥 个人主页: 杨利杰YJlio ❄️ 个人专栏: 《Windows 疑难杂症与工单复盘案例库》 《Sysinternals实战教程》 《WINDOWS教程》 《Windows PowerShell 实战》 《IOS插件分析测试》 《超简单:用Python让Excel飞起来》…

从安全帽检测数据集入门:目标检测项目全流程实战指南

从安全帽检测数据集入门:目标检测项目全流程实战指南

2026/8/28 8:58:58

简介:目标检测是计算机视觉的核心任务之一,旨在识别图像中特定物体的位置与类别。其原理通常基于深度学习模型,通过卷积神经网络提取特征,并利用回归或分类头预测边界框。这项技术的价值在于将视觉信息转化为结构化数据&#xff0…

Hermes Agent 工具调用循环拆解:一次工具调用到底跑了几层

Hermes Agent 工具调用循环拆解:一次工具调用到底跑了几层

2026/8/28 8:58:58

Hermes Agent 工具调用循环拆解:一次工具调用到底跑了几层 【免费下载链接】hermes-agent The agent that grows with you 项目地址: https://gitcode.com/GitHub_Trending/he/hermes-agent 你在聊天里丢一句"把这堆报错修了",屏幕就停…

大脑+小脑协同:人形机器人具身智能架构设计与仿真实现

大脑+小脑协同:人形机器人具身智能架构设计与仿真实现

2026/8/28 8:58:58

这次我们来看一个在具身智能与人形机器人领域反复被强调的判断:“最强大脑”和“最强小脑”相互需要。它说的是大模型负责“动脑”,运动控制负责“动手”。没有运动控制,大模型只能在屏幕里给出建议,机器人动不起来;没…

给Compose加模糊不用自己写:Haze 5分钟集成指南

给Compose加模糊不用自己写:Haze 5分钟集成指南

2026/8/28 8:58:58

给Compose加模糊不用自己写:Haze 5分钟集成指南 【免费下载链接】haze Background blurring for Compose Multiplatform / Jetpack Compose 项目地址: https://gitcode.com/gh_mirrors/ha/haze 列表滚起来,背景一片死白,整个界面看着像…

BCD数据集深度解析:专为YOLO优化的医学细胞检测基准

BCD数据集深度解析:专为YOLO优化的医学细胞检测基准

2026/8/28 8:58:58

简介:BCD(Blood Cell Detection)数据集是面向临床血涂片分析的目标检测专用基准,其本质并非通用图像集合,而是深度融合显微成像物理特性、YOLO多尺度anchor机制与血液学诊断规范的结构化数据体系。它通过严格控制图像分…

YOLOv5舰船检测实战:从数据集解析到模型训练与调优

YOLOv5舰船检测实战:从数据集解析到模型训练与调优

2026/8/28 8:48:58

简介:目标检测是计算机视觉的核心任务之一,旨在识别图像中的特定物体并定位其位置。其原理通常基于深度学习模型,通过卷积神经网络提取特征,并预测边界框和类别。这项技术在安防监控、自动驾驶、工业质检等领域具有重要价值。在海…

[光学原理与应用-521]:对光的错误理解与纠偏

[光学原理与应用-521]:对光的错误理解与纠偏

2026/8/27 11:10:02

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

SIP通话转接原理与REFER方法实战解析

SIP通话转接原理与REFER方法实战解析

2026/8/27 7:25:23

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

2026/8/28 7:34:42

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

基于Claude Code的开源AI求职框架:从职位搜索到Offer的全自动化闭环

基于Claude Code的开源AI求职框架:从职位搜索到Offer的全自动化闭环

2026/8/28 0:08:32

当AI助手能够独立完成从职位匹配、简历定制到面试准备的全链路求职流程时,求职不再是一场信息战,而是一场工程化战役。框架概述:本地运行的AI求职引擎这是一个构建在Claude Code之上的开源AI求职框架,核心理念是"在工作者的机…

Godot 4 仿 agar.io:相机缩放被 max_zoom 卡死,窗口越大球越小的根因与修复

Godot 4 仿 agar.io:相机缩放被 max_zoom 卡死,窗口越大球越小的根因与修复

2026/8/28 0:08:32

1. 问题现象 在 Godot 4 仿 agar.io 的 2D 项目中,相机缩放设计为「由球组整体尺寸决定」,世界可见高度恒定,窗口只作为视口裁剪。默认小窗口 1280x720 时相机高度正常;但窗口最大化到 2940x1912 后,视角被明显拉远、…

从软件测试大赛到实战:Java+Selenium自动化测试进阶指南

从软件测试大赛到实战:Java+Selenium自动化测试进阶指南

2026/8/28 0:08:32

1. 缘起:从校园到赛场,我的软件测试之路几年前,我还是一个在校园里对着Java课本和“Hello World”程序挠头的普通学生。软件测试对我来说,只是一个在开发流程末尾、用鼠标点点按钮的模糊概念。直到我偶然在学校的公告栏上看到了“…

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

2026/8/28 7:35:26

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…

导师推荐!2026最新AI论文工具测评与实用推荐

导师推荐!2026最新AI论文工具测评与实用推荐

2026/8/28 7:34:51

2026年真正好用的AI论文工具,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

告别游戏崩溃:XCOM 2模组管理器的智能革命

告别游戏崩溃:XCOM 2模组管理器的智能革命

2026/8/28 7:34:35

告别游戏崩溃:XCOM 2模组管理器的智能革命 【免费下载链接】xcom2-launcher The Alternative Mod Launcher (AML) is a replacement for the default game launchers from XCOM 2 and XCOM Chimera Squad. 项目地址: https://gitcode.com/gh_mirrors/xc/xcom2-lau…