具身智能开放策略之Octo详解:开放策略如何把多机器人经验变成可微调的通用底座

发布时间:2026/8/27 9:47:42

具身智能开放策略之Octo详解:开放策略如何把多机器人经验变成可微调的通用底座
写在前面【从零走向AGI】旨在深入了解通用人工智能AGI的发展路径从最基础的概念起逐步构建完整的知识体系。项目地址https://github.com/AI-mzq/From-Zero-to-AGI.git魔方AI空间猫先生从零走向AGI面试面经AIGC算法岗/开发岗面试面经交流社群涵盖AI Agent、AIGC图像创作、AI视频、LLM大模型、AI多模态、数字人、传统深度学习、具身智能等AIGC面试干货资源欢迎大家加入https://t.zsxq.com/YtJ09Octo详解开放策略如何把多机器人经验变成可微调的通用底座导读OctoAn Open-Source Generalist Robot Policy要回答的问题是机器人策略能不能像视觉或语言模型一样先在多种机器人、多种任务上预训练再用少量目标域数据迁移到新的平台。论文发布了一个完整开放的通用机器人策略模型、训练代码、数据处理流程和检查点都可获得。它使用 Open X-Embodiment 中筛选出的 25 个数据集、约 80 万条轨迹进行训练并在 9 个机器人设置上评估。Octo 的关键不只是“把数据集做大”而是把不同机器人的输入和输出都拆成可插拔 token。语言指令、目标图像、多个相机和本体感知信息先进入各自 tokenizer再由同一个 Transformer 处理新增传感器或动作空间时只需增加轻量编码器、位置嵌入或 action head就能在下游微调而不必重训整个骨干。动作端使用条件扩散头预测动作片段使策略可以表达多峰、连续的操作分布。实验显示Octo 在预训练分布内可直接控制多种机器人在每个新领域约 100 条示范的条件下微调平均成功率达到 72%高于从头训练和 VC-1 视觉表征基线。它的价值由此落在一个很实际的接口上预训练阶段吸收跨机器人经验部署阶段允许用户更换观察和动作定义。猫先生认为Octo 最值得关注的不是“通用”这个标签而是它把通用性落实成了可替换的输入 token、readout token 和输出 head。机器人形态无法统一时接口的可扩展性比强行寻找一个固定动作空间更重要。论文标题Octo: An Open-Source Generalist Robot Policy论文地址https://arxiv.org/abs/2405.12213项目主页https://octo-models.github.ioGitHubhttps://github.com/octo-models/octo原文脉络论文按照“为什么需要通用策略—Octo 如何设计—跨平台实验—设计选择消融—讨论与未来工作”的顺序展开。前两节说明单机器人、单任务策略的数据成本和泛化边界第三节把灵活 token 接口、跨数据集训练和扩散动作头组合起来第四节分别验证零样本控制、数据高效微调以及架构、数据、目标函数和模型规模的影响。1-2. 背景与相关工作机器人策略为何需要开放接口传统机器人学习通常为一台机器人和一个任务单独采集示范策略输入、相机配置和动作空间在训练时就被固定。跨机器人数据可以增加经验覆盖但不同平台的摄像头、自由度、控制频率和动作定义并不一致直接拼接数据往往会把模型锁死在某一种接口上。此前的 RT-X、RoboCat 等工作证明多机器人预训练有价值但通常限制了下游输入或缺少方便的微调方案。Octo 的定位更接近一个可复用的策略初始化它不承诺一个模型零样本解决所有新任务而是让预训练骨干能够在新传感器、新动作空间和新机器人形态上继续学习。3. Octo 模型把策略接口拆成 token3.1 统一的输入 token 与 Transformer 骨干Octo 将任务定义和观测序列写成统一 token 序列。语言指令经过预训练的 T5-base 编码目标图像和相机图像经过轻量卷积网络后切成 patch token本体状态等结构化信号则由对应的小型 tokenizer 映射到相同维度。序列大致可以写成T [ T T , T o , 1 , T o , 2 , … , T o , H ] p , \mathcal{T}\left[\mathcal{T}_{T},\mathcal{T}_{o,1},\mathcal{T}_{o,2},\ldots,\mathcal{T}_{o,H}\right]p,T[TT​,To,1​,To,2​,…,To,H​]p,其中T T \mathcal{T}_{T}TT​是语言或目标图像等任务 tokenT o , t \mathcal{T}_{o,t}To,t​是第t tt个时刻的观测 tokenp pp是可学习位置嵌入。图 1Octo 以 80 万条 Open X-Embodiment 轨迹预训练同时支持语言或目标图像指令并可微调到新的观察和动作空间。来源论文 Figure 1。Transformer 使用 block-wise attention。当前观测只能访问任务 token 以及当前和过去的观测避免未来信息泄漏数据集中不存在的输入通道则整体 mask。这样带语言和不带语言、单相机和多相机的数据都可以共用同一骨干。3.2 Readout token 与可插拔输出头每个时刻插入一个 learned readout token。它可以读取此前的任务和观测表示却不会反向影响这些 token作用类似 BERT 的[CLS]把到当前时刻为止的上下文压缩成动作解码器需要的向量。新增动作空间时保留 Transformer 参数只增加新的 readout 位置嵌入和输出 head。图 2模型架构与 block-wise attention。虚线模块表示微调时可以新增的传感器或动作输出主干参数无需重新初始化。来源论文 Figure 1Model architecture。猫先生认为Octo 的工程关键是“主干稳定、接口可换”。它没有假设所有机器人都能被压成统一关节向量而是把差异留在输入 tokenizer 和输出 head让共享表示承担跨任务迁移。3.3 扩散动作头预测连续的动作片段Readout embedding 进入轻量条件扩散头。模型从高斯噪声x K x^KxK开始经过K KK次去噪得到一段连续动作而 Transformer 只需前向一次x k − 1 α ( x k − γ ϵ θ ( x k , e , k ) N ( 0 , σ 2 I ) ) . x^{k-1}\alpha\left(x^k-\gamma\epsilon_{\theta}(x^k,e,k)\mathcal{N}(0,\sigma^2I)\right).xk−1α(xk−γϵθ​(xk,e,k)N(0,σ2I)).训练时对专家动作加入噪声再让ϵ θ \epsilon_\thetaϵθ​恢复原动作。动作以 chunk 形式预测能够覆盖多个连续控制步并通过扩散分布表达同一观察下可能存在的多种合理行为。论文的消融显示扩散头比 MSE 动作头或离散化动作分布更适合跨数据集的行为多样性。3.4 训练数据与开放实现Octo 从 Open X-Embodiment 中筛选 25 个包含图像、末端执行器动作且行为较多样的数据集形成约 80 万条轨迹的训练混合。数据预处理会移除没有图像流、分辨率过低或过于重复的数据更丰富的数据集提高采样权重缺失的相机通道用零填充夹爪动作也被对齐到统一语义。模型提供 27M 和 93M 参数两个检查点并开放预训练与微调代码。图 325 个训练数据集在每个 batch 中的采样组成。数据混合同时考虑数据量、行为多样性和重复样本问题。来源论文 Figure 2。4. 实验设置与结果零样本控制和少样本微调4.1 九个机器人设置覆盖不同迁移难点实验覆盖 4 个机构的 9 个真实机器人设置既包括预训练分布中的平台也包括需要新输入、新动作空间或新形态的目标域。评测任务包含长时序操作、精确插入、双臂协作和不同物体交互。图 4九个机器人设置及典型任务。评测同时考察预训练分布内控制和新域微调。来源论文 Figure 3。4.2 零样本目标图像提供更强的任务约束在预训练数据覆盖的环境中Octo 可直接接受自然语言任务并控制多种机器人。与 35M 参数的 RT-1-X 相比平均成功率高出约 29%在 WidowX 和 RT-1 Robot 上其表现与参数量 55B 的 RT-2-X 相近。Octo 还支持目标图像条件在 WidowX 任务上目标图像条件比语言条件高约 25%说明目标状态的视觉描述能减少语言歧义。零样本能力并不等于任意新任务都能执行。新物体通常保持较高成功率但换场景会下降翻转或精确插入等新行为下降更明显这正是微调接口存在的原因。4.3 约 100 条示范即可迁移到新域六个目标域各使用约 100 条示范、统一微调超参数和 20 次试验。Octo 微调成功率分别为 Berkeley Insertion 70%、Stanford Coffee 75%、CMU Baking 50%、Berkeley Pick-Up 60%、Berkeley Coke 100%、Berkeley Bimanual 80%平均 72%。从头训练基线平均 20%VC-1 视觉表征基线平均 15%。这些任务还刻意加入新条件Insertion 增加力矩传感器Pick-Up 和 Bimanual 切换到关节位置控制Coke 和 Bimanual 使用新的机器人形态。Octo 的收益因此不仅来自视觉特征迁移也来自可扩展的观察与动作接口。4.4 设计消融数据规模、灵活性与动作分布同样重要消融围绕四组变量展开。架构方面允许更灵活输入输出的 token 化设计优于固定输入布局数据方面更宽的数据混合通常优于只使用单一数据集目标函数方面扩散动作头优于 MSE 和离散动作头模型规模方面93M 参数模型通常优于 27M但收益取决于数据覆盖和微调设置。图 5论文对不同机器人设置和设计选择的比较结果体现 Octo 在零样本控制与微调中的整体优势。来源论文 Figure 4 及相关实验。猫先生认为实验最有说服力的地方不是单个最高成功率而是同一套微调配方能够跨越传感器、控制方式和机器人形态变化。它把“通用策略”从展示型 demo 推进成了可迁移的工程起点。5. 讨论、局限与可复现性Octo 的开放性覆盖检查点、训练代码、数据处理、微调脚本和监控工具这降低了复现实验和继续训练的门槛。但开放策略仍受数据混合质量制约不同数据集的动作语义、相机分布和任务难度并不完全一致零填充和夹爪对齐只能解决接口层问题不能消除数据偏差。模型在预训练分布外的全新技能、长时序规划和高精度接触操作上仍需要目标域数据。93M 参数规模也不意味着可以忽略真实机器人采集、控制延迟和安全约束。后续工作需要更系统地研究数据权重、跨形态动作表示以及如何让微调不破坏原有通用能力。总结开放策略的核心是可迁移接口Octo 的技术路线可以收束为三点用大规模跨机器人轨迹获得通用初始化用 tokenizer、block-wise attention 和 readout token 保持观察与动作接口可替换用条件扩散头表达连续、多峰的动作片段。结果表明在已有经验覆盖的任务上可以直接控制多种机器人在新传感器、新动作空间和新形态上也能用约 100 条示范完成有效微调。它并没有消除机器人数据和真实部署的成本但把每个新任务从“重新训练一个策略”变成“接入接口并微调一个开放底座”。这正是 Octo 对后续通用机器人模型最实际的贡献。参考资料Octo: An Open-Source Generalist Robot PolicyOcto 官方项目主页Octo GitHub推荐阅读► 技术资讯 魔方 AI 新视界► 项目应用开源视界► 技术专栏 多模态大模型最新技术解读专栏 | AI 视频最新技术解读专栏 | 大模型基础入门系列专栏 | 视频内容理解技术专栏 | 从零走向 AGI 系列

相关新闻

Python SQLAlchemy 与数据库操作讲解

Python SQLAlchemy 与数据库操作讲解

2026/8/27 9:47:42

文章目录一、核心概念二、安装三、快速开始(SQLAlchemy 2.0 风格)1. 创建引擎与基类2. 定义模型3. 创建表四、最常用的 CRUD 操作1. 增加(Create)2. 查询(Read)3. 更新(Update)4. 删…

Java大厂面试实录:Spring Boot + Kafka + Redis + Spring Security + RAG 的三轮攻防

Java大厂面试实录:Spring Boot + Kafka + Redis + Spring Security + RAG 的三轮攻防

2026/8/27 9:47:41

Java大厂面试实录:Spring Boot Kafka Redis Spring Security RAG 的三轮攻防场景:某互联网大厂 Java 岗位面试现场。面试官表情严肃,候选人燕双非一脸轻松,主打一个“我可能不全会,但我会努力胡说八道”。第一轮&a…

跨境ETF套利策略设计:从理论价差到实战风控

跨境ETF套利策略设计:从理论价差到实战风控

2026/8/27 9:37:41

1. 从一道赛题到实战:跨境ETF套利策略的深度拆解 最近翻看去年的一些数学建模竞赛题目,发现“2023大湾区杯”的A题“跨境ETF套利策略设计”很有意思。这道题没有像很多传统题目那样给出海量的历史数据让你去拟合,而是直接抛出了一个非常贴近真…

自媒体传播建模实战:SEIR改进与元胞自动机嵌套设计

自媒体传播建模实战:SEIR改进与元胞自动机嵌套设计

2026/8/27 10:47:54

1. 这不是一份“标准答案”,而是一份真实跑通的建模手记2017年五一杯数学建模B题——“自媒体时代的消息传播问题”,表面看是道典型的传染病模型题,但真正动手做下来,你会发现它根本不是套个SEIR公式、调个ode45就能交卷的作业。我…

产品动态设计实战:从SURI牙刷看品牌视觉叙事与工作流

产品动态设计实战:从SURI牙刷看品牌视觉叙事与工作流

2026/8/27 10:47:54

一个动态设计作品被放到评审会上,客户看完后提出的第一个问题往往不是“这个镜头语言是否准确”,而是“牙刷能不能转得再快一点”。真正做过产品动态设计的人都知道,这种反馈背后的问题从来不是转速,而是整支片子没有建立起一个让…

随手记录 利用全志T153,点亮OLED屏幕,显示当地天气

随手记录 利用全志T153,点亮OLED屏幕,显示当地天气

2026/8/27 10:47:54

学习了正点原子的imx6ull 好几遍,有了思路框架后,想试试自己不靠教程点亮个屏幕试试,手上有两块创龙的开发板,先玩玩T153吧。我用的是docker 容器当开发环境,在Windows上远程开发。(需要先执行提供的脚本&a…

LoRA权重合并实战:从分体式微调到一体化模型部署

LoRA权重合并实战:从分体式微调到一体化模型部署

2026/8/27 10:47:54

1. 从“分体式”到“一体化”:为什么我们需要合并LoRA权重 如果你最近在折腾大语言模型微调,尤其是用上了像LLaMA-7B、Qwen这样的开源基座,那你大概率已经接触过LoRA(Low-Rank Adaptation)这种高效的微调方法了。它的好…

CPLD与FPGA有什么区别

CPLD与FPGA有什么区别

2026/8/27 10:47:54

CPLD和FPGA都是可编程逻辑器件,核心区别可以这样理解:CPLD更像是一块在出厂时(或通过简单编程)就固定了“硬逻辑”的电路板,上电即用,时序精确;而FPGA则像一堆可以任意组合的“乐高积木”,功能更强大、更灵活,但需要在上电时从外部加载配置 ⚙️ 核心架构与逻辑实现 …

AI编码代理的隐性成本:“氛围税”如何悄悄拖慢你的团队

AI编码代理的隐性成本:“氛围税”如何悄悄拖慢你的团队

2026/8/27 10:37:44

我们团队引入 AI 编码代理已经半年了,最开始的体感是真的爽。新功能从需求到原型,代码补全几乎不用等,甚至能一口气生成一整套文件。但最近一次复盘,大家算了一笔账之后沉默了:效率提升没有想象中明显,反而…

[光学原理与应用-521]:对光的错误理解与纠偏

[光学原理与应用-521]:对光的错误理解与纠偏

2026/8/26 1:50:39

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

SIP通话转接原理与REFER方法实战解析

SIP通话转接原理与REFER方法实战解析

2026/8/27 7:25:23

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

2026/8/26 17:50:58

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

Go语言构建企业级AI服务网关:统一管理英伟达等AI接口调用

Go语言构建企业级AI服务网关:统一管理英伟达等AI接口调用

2026/8/27 0:07:12

1. 项目概述:从零构建一个企业级的AI服务网关 最近在帮一个做内容审核的团队做技术架构升级,他们原来的业务里,每天有几十万张图片和短视频需要过审,最初是接了几个开源的AI模型自己部署,但效果和性能一直不太稳定。后…

LeetCode Hot100(51-60)算法精解与面试技巧

LeetCode Hot100(51-60)算法精解与面试技巧

2026/8/27 0:07:12

1. 题目背景与核心价值"hot100(51-60)"这个标题看起来像是某个编程题库或算法练习集中的一组题目编号。在技术社区中,类似命名通常指向LeetCode、牛客网等平台的热门题目集合。作为刷过300题的算法老手,我理解这类题目的核心价值在于&#xff…

CRC校验实战:从模2除法到HJ212协议排错

CRC校验实战:从模2除法到HJ212协议排错

2026/8/27 0:07:12

1. 为什么一个“校验码”能扛住工业现场90%的数据 corruption? 你有没有遇到过这样的场景:嵌入式设备通过RS-485上传温湿度数据,上位机偶尔收到一帧乱码——温度显示成-273℃,湿度跳到999%,但串口波形看起来完全正常&a…

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

2026/8/22 2:02:26

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…

导师推荐!2026最新AI论文工具测评与实用推荐

导师推荐!2026最新AI论文工具测评与实用推荐

2026/8/26 18:07:30

2026年真正好用的AI论文工具,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

告别游戏崩溃:XCOM 2模组管理器的智能革命

告别游戏崩溃:XCOM 2模组管理器的智能革命

2026/8/26 17:57:52

告别游戏崩溃:XCOM 2模组管理器的智能革命 【免费下载链接】xcom2-launcher The Alternative Mod Launcher (AML) is a replacement for the default game launchers from XCOM 2 and XCOM Chimera Squad. 项目地址: https://gitcode.com/gh_mirrors/xc/xcom2-lau…