【ICML 2025 (Poster)】在上下文强化学习中缩放通用智能体:Vintix 动作模型|从上下文强化学习规模化视角

发布时间:2026/8/20 9:19:08

【ICML 2025 (Poster)】在上下文强化学习中缩放通用智能体:Vintix 动作模型|从上下文强化学习规模化视角
摘要本文解读 ICML 2025Poster论文《Vintix: Action Model via In-Context Reinforcement Learning》。该论文提出Vintix 跨域动作模型通过融合连续噪声蒸馏、跨域数据集与算法蒸馏让 300M 参数的固定权重模型在推理时通过试错自纠错其特别之处在于坚持数据为中心与奖励足够Reward is enough路线。实验表明Vintix 在 Meta-World 与 MuJoCo 上显著超越 JAT 和 REGENT如 Humanoid 示范者归一化回报 0.97 vs 0.02并为上下文强化学习的规模化提供了 87 任务 × 4 域的开源数据集与工具。视频讲解点击观看 B 站视频摘要论文基本信息背景与动机为什么通用动作模型需要 ICRL研究主线从问题到结论基准/方法设计Vintix 的三阶段流水线分类全景四域跨域数据集方法细节连续噪声蒸馏与训练配置实验设计与结果自纠错、对比与泛化结果对比总结关键发现局限性常见问题FAQVintix 是什么什么是上下文强化学习ICRLVintix 与 JAT、REGENT 有什么区别为什么噪声蒸馏能替代真实 RL 学习历史Vintix 能泛化到全新任务吗去掉奖励信号会怎样参考链接论文基本信息项目内容标题英文Vintix: Action Model via In-Context Reinforcement Learning标题中文在上下文强化学习中缩放通用智能体Vintix 动作模型作者Andrei Polubarov · Nikita Lyubaykin · Alexander Derevyagin · Ilya Zisman · Denis Tarasov · Alexander Nikulin · Vladislav Kurenkov机构AIRI · Innopolis University · Skoltech · MIPT · HSE · ISP RAS会议ICML 2025 (Poster)arXiv2501.19400项目网站dunnolab/Vintix (HuggingFace) · GitHub背景与动机为什么通用动作模型需要 ICRL通用控制与决策智能体的长期目标是用一个模型处理多样化任务并具备自纠错、自改进等适应能力。传统在线强化学习如 AlphaStar、Dota 五杀 AI在窄域内性能极强但依赖环境特定交互训练难以规模化。现有跨域动作模型大致分两条路线返回条件路线利用全部数据按 return-to-go 目标做条件化upside-down RL 思想示范蒸馏路线当前主流只用专家示范、基本丢弃奖励信号代表工作为Gato、JAT、REGENT、Open X-Embodiment 等。与之相对Reward is enough 原则主张智能体应通过试错最大化任意奖励。算法蒸馏AD, Laskin et al. ICLR 2023把这一原则操作化在历史 RL 轨迹上训练 next-action 预测模型从而在推理时涌现上下文强化学习ICRL。然而此前的 ICRL 只在离散动作玩具任务、单域设定下成立——这正是 Vintix 要填补的空白跨域、连续动作、87 个任务规模的数据为中心 ICRL。研究主线从问题到结论图 8研究主线——从跨域 ICRL 未缩放问题到超越 JAT/REGENT 的结论Mermaid 流程图基准/方法设计Vintix 的三阶段流水线Vintix 是一个300M 参数、24 层、16 头的 next-action 预测模型基于TinyLLaMA骨干编码器-Transformer-解码器结构。方法分三阶段连续噪声蒸馏CND在示范策略上注入逐步退火的均匀噪声制造策略改进轨迹替代昂贵耗时的真实 RL 学习历史跨域数据集把 4 个域 87 个任务的多回合序列合并为共享数据集1.6M 回合 / 222.7M 时间步算法蒸馏训练用 ${s, a, r}$ 三元组训练目标仅为下一动作预测MSE 损失。图 1多回合 ICRL 自纠错——训练任务87 个上各域逐步接近示范者性能柱内数字为最优 shot 数关键设计要素维度分组编码按观测/动作维度分组每组独立 encoder/decoder 头映射到共享嵌入空间模型只知道组 ID、不知道任务 ID是真正的 task-agnosticToken 堆叠把前一动作 前一奖励 当前观测堆成一个 token上下文窗口等效扩大 3 倍推理协议空上下文冷启动 滑动窗口 ALiBi 位置编码 FlashAttention KV-cache绝对位置编码与滑动窗口不兼容。分类全景四域跨域数据集图 9跨域数据集分类全景——87 任务按四域划分Mermaid 流程图方法细节连续噪声蒸馏与训练配置连续噪声蒸馏CND是本文对 $AD^\epsilon$ 的连续动作扩展。动作定义为示范动作与均匀噪声的线性混合$a_i (1-\epsilon_i) \cdot \pi_D(s_i) \epsilon_i \cdot u$其中 $u \sim \text{Uniform}(a_{min}, a_{max})$噪声系数 $\epsilon$ 从 1随机策略退火到 0示范策略。与 $\epsilon$-greedy 的全随机/全专家交替不同线性混合产生平滑的回报曲线更接近真实学习历史。实际使用广义退火函数 $\epsilon(n_s)$ 控制轨迹内噪声形状奖励前期陡增的任务用 $p 1$ 压平起始段后期陡增的任务用 $0 p 1$ 反向调节——线性退火在某些任务上会产生突变轨迹损害收敛。训练配置8×H100batch 64梯度累积 2序列长度 $L8192$学习率 $3\times10^{-4}$bf16 精度。数据侧奖励按任务缩放、观测归一化刻意降低任务可区分度逼模型依赖上下文推断任务。图 2Vintix 三阶段流程——连续噪声蒸馏生成改进轨迹合并为跨域数据集再运行算法蒸馏实验设计与结果自纠错、对比与泛化评测协议冷启动推理空上下文逐回合展开度量示范者归一化回报自纠错收敛后取 100 回合平均。基线包括 JAT、REGENT论文成绩直取以及本文训练的专家蒸馏ED和无奖励消融变体。训练数据集统计附录 A 织入域任务数回合数时间步样本权重Bi-DexHands15216k31.7M14.2%Industrial-Benchmark1696k24M10.8%Meta-World45670k67M30.1%MuJoCo11665k100M44.9%总体871.6M222.7M100%MuJoCo 逐任务对比示范者归一化回报任务VintixREGENTJATAnt0.980.170.88HalfCheetah0.930.340.89Hopper0.860.120.76Humanoid0.970.020.10HumanoidStandup1.020.260.35Walker2d1.000.050.95图 3连续噪声蒸馏轨迹——四域聚合归一化回报随轨迹长度平滑上升图 4域级对比——Vintix 在 MuJoCo 与 Meta-World 均显著超越 JAT 与 REGENT收敛后 100 回合参数变化泛化MuJoCo 黏度0→0.05/0.1与重力±10%扰动、Industrial-Benchmark 新设定点 $p \in [80,100]$ 均接近示范者仅收敛略慢。图 5参数变化冷启动推理——MuJoCo 黏度/重力扰动与 IB 新设定点下仍接近示范者全新任务Door-Unlock 达 47% 专家归一化分数Door-Open-Inward 稳定 31%其余接近随机——跨域 ICRL 仍需缩放。图 6全新任务推理表现——每个域各一个成功与失败案例消融附录 B 织入同架构同损失仅训练数据不同——ED 渐近归一化分数仅 0.8AD 达 MuJoCo 0.97 / Meta-World 0.95去掉奖励信号的 AD 变体渐近更差、收敛更慢。策略改进结构是自纠错行为的来源奖励反馈是推理时有效自改进的必要信号。图 7消融实验——完整 AD 渐近最高ED 明显偏低无奖励变体收敛最慢结果对比总结图 10结果对比总结——示范蒸馏基线、自纠错 0.97、AD 优于 ED 与新任务成绩Mermaid 流程图关键发现87 任务 × 4 域、1.6M 回合、222.7M 时间步的开源跨域数据集是 ICRL 社区首个跨域训练场自纠错随回合数单调渐进四个域一致地从次优收敛到示范者水平是推理时隐式强化学习的标志性现象算法蒸馏显著优于专家蒸馏AD 渐近 0.97MuJoCo/ 0.95Meta-WorldED 仅 0.8——同样示范者来源差距全来自数据里的改进结构Humanoid 归一化回报 0.97 vs REGENT 0.02 / JAT 0.10Vintix 在 MuJoCo 与 Meta-World 全面超越示范蒸馏型通用动作模型参数变化可适应未见过的黏度、重力与设定点 $p \in [80,100]$ 下仍接近示范者仅收敛略慢全新任务初见苗头Door-Unlock 达 47%、Door-Open-Inward 稳定 31% 示范者分数其余接近随机。局限性任务规模有限仅 87 任务原始 AD 的玩具设定任务集都更大跨域 ICRL 仍需数据缩放仅连续向量观测刻意隔离多模态输入未处理视觉/语言离真实机器人数据尚远全新任务泛化失败未见任务的 in-context 推断任务结构尚未实现仅个别任务部分成功无法超越示范者性能上界受示范者约束无超越示范者水平的自改进能力。常见问题FAQVintix 是什么Vintix 是 AIRI 团队提出的300M 参数跨域动作模型通过算法蒸馏AD把策略改进轨迹蒸馏进 Transformer在推理时用上下文强化学习ICRL自纠错覆盖 MuJoCo、Meta-World、Bi-DexHands、Industrial-Benchmark 四域 87 任务。什么是上下文强化学习ICRLICRL 指智能体在推理时通过试错与奖励信号学习不更新任何权重——类似大语言模型的上下文学习但目标是奖励最大化。Vintix 的冷启动自纠错就是 ICRL 的典型现象。Vintix 与 JAT、REGENT 有什么区别JAT 和 REGENT 走专家示范蒸馏路线Vintix 走奖励驱动的算法蒸馏路线训练数据是噪声蒸馏出的改进轨迹而非纯示范。结果是 Vintix 具备推理时自纠错能力在 MuJoCo 与 Meta-World 上显著超越二者如 Humanoid 0.97 vs 0.02/0.10。为什么噪声蒸馏能替代真实 RL 学习历史真实学习历史昂贵且含训练不稳定噪声连续噪声蒸馏用逐步退火的均匀噪声混合示范动作低成本制造近似策略改进的轨迹。消融显示用这种结构训练的 AD 模型渐近 0.97/0.95而用纯示范训练的 ED 只有 0.8。Vintix 能泛化到全新任务吗尚不能。在未见任务上Door-Unlock 达到 47%、Door-Open-Inward 稳定 31% 示范者分数其余接近随机。作者认为需要更大任务规模与更 task-agnostic 的架构。去掉奖励信号会怎样奖励掩码消融显示无奖励变体渐近性能更差、收敛更慢Meta-World 尤甚。奖励反馈是推理时有效自改进的必要信号也是Reward is enough路线的直接证据。参考链接arXiv 2501.19400Vintix: Action Model via In-Context Reinforcement Learningdunnolab/Vintix 项目主页HuggingFaceIn-Context Reinforcement Learning with Algorithm DistillationLaskin et al., ICLR 2023Emergence of In-Context Reinforcement Learning from Noise DistillationZisman et al., 2024Jack of All Trades, Master of Everything (JAT)Gallouédec et al., TMLR 2024REGENT: A Retrieval-Augmented Generalist AgentSridhar et al., NeurIPS 2024给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件

相关新闻

AI智能体本地化实战:赋予Agent感知与操作电脑能力

AI智能体本地化实战:赋予Agent感知与操作电脑能力

2026/8/20 9:19:08

最近在尝试让 AI 智能体帮我处理一些本地文件、运行脚本或者查询系统信息时,发现一个核心痛点:这些智能体大多“生活”在云端,对运行它们的“电脑”本身几乎一无所知。它们无法直接读取我的文档,不能帮我整理桌面,更别…

2026大厂软件测试面试趋势与高频技术解析

2026大厂软件测试面试趋势与高频技术解析

2026/8/20 9:19:08

1. 2026大厂软件测试面试趋势前瞻 最近帮几位准备跳槽的测试工程师朋友做模拟面试,发现大厂对测试人员的考察维度正在发生明显变化。相比五年前偏重手工测试用例设计的考核方式,如今头部互联网企业的面试官更关注候选人在自动化测试、质量保障体系、持续…

ESP32与Boltiot物联网数据采集:从传感器到云端可视化的完整实践

ESP32与Boltiot物联网数据采集:从传感器到云端可视化的完整实践

2026/8/20 9:09:07

1. 项目概述:当ESP32遇上Boltiot,自动化数据采集的落地实践 最近在折腾一个物联网项目,核心需求是把一堆传感器数据自动、稳定地传到云端,并且最好能有个直观的看板。手头正好有ESP32开发板,而云端平台我选择了Boltiot…

原神成就数据导出怕麻烦?YaeAchievement 免费工具让你 5 分钟拿到全部数据

原神成就数据导出怕麻烦?YaeAchievement 免费工具让你 5 分钟拿到全部数据

2026/8/20 10:19:10

原神成就数据导出怕麻烦?YaeAchievement 免费工具让你 5 分钟拿到全部数据 【免费下载链接】YaeAchievement 更快、更准的原神数据导出工具 项目地址: https://gitcode.com/gh_mirrors/ya/YaeAchievement 换设备那天,我才发现成就"带不走&qu…

照片上的经纬度地址等怎么弄的?2026最新教程:相机无GPS也能写入坐标

照片上的经纬度地址等怎么弄的?2026最新教程:相机无GPS也能写入坐标

2026/8/20 10:19:10

照片上的经纬度地址等怎么弄的?2026最新教程:相机无GPS也能写入坐标 照片上的经纬度地址等怎么弄的?很多人想到的是打开地图App手动标注,或是掏出手机翻设置,折腾半天只能一张张处理,碰上批量需求更是耗时…

TMSpeech免费离线语音转文字工具终极指南:Windows实时字幕一劳永逸

TMSpeech免费离线语音转文字工具终极指南:Windows实时字幕一劳永逸

2026/8/20 10:19:10

TMSpeech免费离线语音转文字工具终极指南:Windows实时字幕一劳永逸 【免费下载链接】TMSpeech 腾讯会议摸鱼工具 项目地址: https://gitcode.com/gh_mirrors/tm/TMSpeech TMSpeech 是一款完全免费、开源的 Windows 离线语音转文字工具:它会实时捕…

输入法状态显示工具实时显示中英文切换

输入法状态显示工具实时显示中英文切换

2026/8/20 10:19:10

ImTip 今天要分享一款实用小工具——ImTip。这款软件的功能特别直接:在你切换输入法的时候,实时显示当前输入法的状态,让你一眼就知道现在是中文还是英文、大写还是小写。 解决什么问题 平时打字的时候,经常忘记当前输入法处于什…

小红书图片格式转换终极指南:HEIC、WEBP下载后打不开?XHS-Downloader一键转JPEG

小红书图片格式转换终极指南:HEIC、WEBP下载后打不开?XHS-Downloader一键转JPEG

2026/8/20 10:19:10

小红书图片格式转换终极指南:HEIC、WEBP下载后打不开?XHS-Downloader一键转JPEG 【免费下载链接】XHS-Downloader 小红书(XiaoHongShu、RedNote)链接提取/作品采集工具:提取账号发布、收藏、点赞、专辑作品链接&#x…

Spring Boot 3.x 虚拟线程实战:高并发改造与线上避坑指南

Spring Boot 3.x 虚拟线程实战:高并发改造与线上避坑指南

2026/8/20 10:09:10

在 JDK 21 之前写高并发 Java 服务,基本就是跟 ThreadPoolExecutor 死磕。线程开多了 OOM,开少了请求排队超时。微服务架构下,网络 IO 和下游 RPC 调用占掉大半时间,传统 1:1 平台线程模型里,大量线程卡在 WAITING 状态…

【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

2026/8/19 3:36:59

✅作者简介:热爱科研的Matlab仿真开发者,擅长毕业设计辅导、数学建模、数据处理、建模仿真、程序设计、完整代码获取、论文复现及科研仿真。🍎 往期回顾关注个人主页:Matlab科研工作室👇 关注我领取海量matlab电子书和…

【双层规划,节点出清价,绿证交易,CVaR方法】两级电力市场环境下计及风险的省间交易商最优购电模型附Matlab代码

【双层规划,节点出清价,绿证交易,CVaR方法】两级电力市场环境下计及风险的省间交易商最优购电模型附Matlab代码

2026/8/19 9:17:18

✅作者简介:热爱科研的Matlab仿真开发者,擅长毕业设计辅导、数学建模、数据处理、建模仿真、程序设计、完整代码获取、论文复现及科研仿真。🍎 往期回顾关注个人主页:Matlab科研工作室👇 关注我领取海量matlab电子书和…

隐式mpc+自适应mpc+时变mpc,线性时变模型预测控制附Simulink仿真

隐式mpc+自适应mpc+时变mpc,线性时变模型预测控制附Simulink仿真

2026/8/19 8:02:16

✅作者简介:热爱科研的Matlab仿真开发者,擅长毕业设计辅导、数学建模、数据处理、建模仿真、程序设计、完整代码获取、论文复现及科研仿真。🍎 往期回顾关注个人主页:Matlab科研工作室👇 关注我领取海量matlab电子书和…

微信聊天记录如何完整导出?WeChatMsg备份指南:HTML/Word/CSV一键转换

微信聊天记录如何完整导出?WeChatMsg备份指南:HTML/Word/CSV一键转换

2026/8/20 0:08:45

微信聊天记录如何完整导出?WeChatMsg备份指南:HTML/Word/CSV一键转换 【免费下载链接】WeChatMsg 提取微信聊天记录,将其导出成HTML、Word、CSV文档永久保存,对聊天记录进行分析生成年度聊天报告 项目地址: https://gitcode.com…

B站缓存m4s打不开?m4s-converter无损合成MP4,实测1.46GB仅5秒

B站缓存m4s打不开?m4s-converter无损合成MP4,实测1.46GB仅5秒

2026/8/20 0:08:45

B站缓存m4s打不开?m4s-converter无损合成MP4,实测1.46GB仅5秒 【免费下载链接】m4s-converter 一个跨平台小工具,将bilibili缓存的m4s格式音视频文件合并成mp4 项目地址: https://gitcode.com/gh_mirrors/m4/m4s-converter 判断你是否…

告别白模时代:Blender3mfFormat 让 3MF 导入导出一次跑通设计到打印

告别白模时代:Blender3mfFormat 让 3MF 导入导出一次跑通设计到打印

2026/8/20 0:08:45

告别白模时代:Blender3mfFormat 让 3MF 导入导出一次跑通设计到打印 【免费下载链接】Blender3mfFormat Blender add-on to import/export 3MF files 项目地址: https://gitcode.com/gh_mirrors/bl/Blender3mfFormat 按 3MF 官方规范的字面意思,一…

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

2026/8/17 12:00:53

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…

导师推荐!2026最新AI论文工具测评与实用推荐

导师推荐!2026最新AI论文工具测评与实用推荐

2026/8/15 10:10:27

2026年真正好用的AI论文工具,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

告别游戏崩溃:XCOM 2模组管理器的智能革命

告别游戏崩溃:XCOM 2模组管理器的智能革命

2026/8/18 12:20:24

告别游戏崩溃:XCOM 2模组管理器的智能革命 【免费下载链接】xcom2-launcher The Alternative Mod Launcher (AML) is a replacement for the default game launchers from XCOM 2 and XCOM Chimera Squad. 项目地址: https://gitcode.com/gh_mirrors/xc/xcom2-lau…