InternVL3_5-30B-A3B-Instruct训练管线全解:从CPT、SFT到Cascade RL强化学习

发布时间:2026/8/26 13:56:29

InternVL3_5-30B-A3B-Instruct训练管线全解:从CPT、SFT到Cascade RL强化学习
InternVL3_5-30B-A3B-Instruct训练管线全解从CPT、SFT到Cascade RL强化学习【免费下载链接】InternVL3_5-30B-A3B-Instruct项目地址: https://ai.gitcode.com/hf_mirrors/OpenGVLab/InternVL3_5-30B-A3B-InstructInternVL3.5-30B-A3B-Instruct是 OpenGVLab 开源的多模态大模型系列中的轻量高效成员总参数 30.8B但每个 token 仅激活约 3BMoE 架构单张 A100 显卡即可部署。本文将带你完整看懂它的训练管线——多模态继续预训练CPT、监督微调SFT与级联强化学习Cascade RL新手也能轻松理解每一步在做什么。一图看懂训练管线全景InternVL3.5 的训练分为四个阶段逐层递进CPT多模态继续预训练→ SFT监督微调→ MPO离线强化学习→ GSPO在线强化学习后两步 MPO GSPO 合称为Cascade Reinforcement Learning级联强化学习Cascade RL是 InternVL3.5 的核心创新先用离线 RL 稳定打基础再用在线 RL 精细调优以较少的 GPU 成本换来了显著的性能提升。模型系列按训练进度开放了不同半成品权重方便研究者对比实验模型后缀已完成的训练阶段-PretrainedCPT-Instruct本文主角CPT SFT-MPOCPT SFT MPO离线 RL无后缀如 InternVL3.5-30B-A3B全流程 CPT SFT Cascade RL⚠️ 官方提醒不确定用哪个版本时请选无后缀的完整版——它走完了全部训练管线推理能力最强。本仓库对应的-Instruct版本完成了 CPT SFT 两个阶段是构建下游应用与二次微调的理想基座。阶段一CPT 多模态继续预训练CPTContinual Pre-Training是整个管线的地基。这一阶段用大规模文本 图文混合语料联合更新全部参数让视觉编码器InternViT-300M与语言模型Qwen3-30B-A3B MoE真正学会说同一种语言。核心要点训练目标标准 Next Token Prediction损失计算在文本 token 上进行前缀 token 可以是文本也可以是图像平方平均重加权对话样本只对回答部分计损失并用1/√NN 为样本长度重新加权避免模型偏向过长或过短的回答随机 JPEG 压缩训练时对图像做随机 JPEG 压缩提升模型对真实世界低质量图片的鲁棒性CPT 之后的产物就是-Pretrained模型——它懂图像、懂文本但还不会好好回答问题。阶段二SFT 监督微调——教会模型思考SFTSupervised Fine-Tuning阶段沿用 CPT 的损失函数与平方平均策略但把上下文窗口扩大到32K tokens以适应长上下文。真正让 InternVL3.5 与上一代拉开差距的是 SFT 数据的三个来源指令跟随数据复用 InternVL3 的高质量指令数据保持视觉-语言任务的广泛覆盖思考模式多模态推理数据先用大模型描述图像再把描述喂给 DeepSeek-R1 采样出带详细推理过程的回答过滤掉答案错误的样本覆盖数学、科学等专家领域——这正是模型深度思考能力的来源能力扩展数据GUI 交互、具身智能、矢量图SVG等新技能本仓库-Instruct版本就是 CPT SFT 完成后的产物已经具备强大的对话、理解与推理能力。阶段三Cascade RL 级联强化学习——粗到精的两段式训练Cascade RL 是 InternVL3.5 的杀手锏分两步走3.1 离线 RLMPO 混合偏好优化高效热身MPOMixed Preference Optimization的损失由三部分加权组成$$ \mathcal{L}_{\text{MPO}} w_p\mathcal{L}_p w_q\mathcal{L}_q w_g\mathcal{L}_g $$偏好损失DPO 形式学习什么是更好的回答质量损失BCO 形式锚定高质量回答的标准生成损失LM 形式保证语言能力不退化作为离线RLMPO 基于预先准备好的偏好数据训练收敛稳定相当于高效的热身——为下一阶段提供高质量的 rollout模型自生成回答。3.2 在线 RLGSPO精雕细琢GSPO 是面向在线 RL 的算法基于模型自己生成的回答继续优化输出分布类似 GRPO对同一问题采样的多条回答做奖励归一化计算优势重要性采样比取逐 token 比的几何平均训练更稳无需参考模型约束对稠密模型与 MoE 模型都有效——这对 30B-A3B 这样的 MoE 架构尤为友好为什么级联更好单用离线 RL 容易过拟合固定数据单用在线 RL 冷启动成本高、波动大。级联策略让离线阶段打稳地基、在线阶段快速冲刺官方消融实验显示其在 MMMU、MathVista 等推理基准上显著优于单一方案且 GPU 成本更低。30B-A3B 架构为什么部署如此便宜理解训练管线后再看看这个主角本身的架构设计ViT–MLP–LLM 三段式视觉编码器 InternViT-300M → MLP 投影层 → Qwen3-30B-A3B 语言模型MoE 稀疏激活每层含 128 个专家每个 token 只激活 8 个见 config.json 中num_experts: 128、num_experts_per_tok: 8配置总参数 30.5B 但激活参数仅约 3B动态高分辨率沿用 InternVL1.5 的动态切块策略max_dynamic_patch: 12最多将图像切成 12 块送入 ViT专家权分层分片语言模型各层专家权重按层存成独立分片layer-0-ep-0-of-1.safetensors…layer-47-ep-0-of-1.safetensors共 48 个分片由 model.safetensors.index.json 统一索引支持按需加载模型结构与对话模板定义在 modeling_internvl_chat.py、configuration_internvl_chat.py 与 conversation.py 中视觉编码器实现在 modeling_intern_vit.py 与 configuration_intern_vit.py权重存于 vision.safetensors。关键参数数值含义总参数 / 激活参数30.8B / ~3BMoE 稀疏激活推理成本低语言模型层数48 层对应 48 个专家权重分片专家数 / 每 token 激活数128 / 8路由选择机制上下文窗口32KSFT 设定支持长文档长视频部署门槛单张 A10030B 级别可单卡运行进阶能力Thinking 模式与测试时扩展-Instruct版本已包含 SFT 注入的思考能力开启方式只需一条系统提示词官方推荐do_sampleTrue、temperature0.6避免重复深度思考Deep Thinking让模型先在think标签内分步推理、校验中间结论再给出最终答案并行思考Parallel ThinkingBest-of-N 策略用 VisualPRM 视觉过程奖励模型从多条推理候选中选出最优扩展推理广度官方论文实验均未默认开启测试时扩展TTS——因为感知类任务收益有限TTS 只在数学/推理类基准上进一步放大优势。如何获取完整管线产物若你希望使用走完CPT SFT Cascade RL全流程的版本即无后缀的InternVL3.5-30B-A3B可直接通过 git 拉取官方仓库获取权重与说明git clone https://gitcode.com/hf_mirrors/OpenGVLab/InternVL3_5-30B-A3B-Instruct模型基于 transformers 生态加载建议transformers4.52.1配合trust_remote_codeTrue即可使用仓库自带的 modeling_internvl_chat.py 自定义代码部署侧 LMDeploy 与 vLLM 均可支持。常见问题 FAQQ1-Instruct、-MPO、无后缀版本到底差在哪A差在训练管线的进度。-Instruct CPTSFT会对话-MPO 再加离线 RL推理更强无后缀 再加在线 RL推理最强、最完整。追求最佳效果选无后缀版本。Q2为什么 MoE 版本训练/部署都更划算A128 个专家中每 token 只激活 8 个计算量只花3B 的力气却拥有 30.5B 的知识容量。这也是 GSPO 特意去掉了参考模型约束仍能有效的原因——它对小激活参数量的 MoE 更稳。Q3Cascade RL 比单阶段 RL 强多少A相比 InternVL3InternVL3.5 整体推理性能最高提升16.0%推理速度提升4.05×而级联设计本身让强化学习阶段用更少的 GPU 时间达到更好效果。Q4想自己微调该用哪个版本作基座A日常指令微调选-Instruct本仓库即可若做推理类任务建议以-MPO或完整版为基座起点更高。总结InternVL3.5-30B-A3B-Instruct 背后的训练管线是一条教科书式的能力递进链CPT让视觉与语言对齐奠定理解能力SFT注入对话规范与思考模式产出本仓库权重MPO离线 RL稳定热身建立偏好判断GSPO在线 RL自我博弈精调推理能力登顶作为 HuggingFace 镜像中可直接下载的资源这套权重 自定义代码结构清晰、文档完备无论是多模态应用开发、二次微调还是训练方法研究都是从 CPT、SFT 到 Cascade RL 全解的绝佳样本。【免费下载链接】InternVL3_5-30B-A3B-Instruct项目地址: https://ai.gitcode.com/hf_mirrors/OpenGVLab/InternVL3_5-30B-A3B-Instruct创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

L2Cache快速入门教程:10分钟将Caffeine+Redis二级缓存接入Spring Boot(附完整配置)

L2Cache快速入门教程:10分钟将Caffeine+Redis二级缓存接入Spring Boot(附完整配置)

2026/8/26 13:56:29

L2Cache快速入门教程:10分钟将CaffeineRedis二级缓存接入Spring Boot(附完整配置) 【免费下载链接】l2cache L2Cache 是一个基于 Caffeine Redis 的二级缓存框架。让缓存的使用在业务开发中更加简单、高效。 项目地址: https://gitcode.co…

Ain模板文件语法详解:8大Section从[Host]到[Backend]一次看懂.ain格式的完全指南

Ain模板文件语法详解:8大Section从[Host]到[Backend]一次看懂.ain格式的完全指南

2026/8/26 13:56:29

Ain模板文件语法详解:8大Section从[Host]到[Backend]一次看懂.ain格式的完全指南 【免费下载链接】ain A HTTP API client for the terminal 项目地址: https://gitcode.com/gh_mirrors/ai/ain Ain 是一款运行在终端里的 HTTP API 客户端,是 Post…

HyperLine Git状态栏插件详解:分支、脏文件与推送状态一栏尽览

HyperLine Git状态栏插件详解:分支、脏文件与推送状态一栏尽览

2026/8/26 13:56:29

HyperLine Git状态栏插件详解:分支、脏文件与推送状态一栏尽览 【免费下载链接】hyperline ✨ Status line plugin for Hyper ✨ 项目地址: https://gitcode.com/gh_mirrors/hy/hyperline HyperLine 是一款为 Hyper 终端打造的轻量级状态栏插件(s…

C++起步知识

C++起步知识

2026/8/26 14:46:31

目录1 域2 namespace 关键字2.1 命名空间的定义2.2 命名空间的使用2.3 命名空间的作用3 缺省参数4 函数重载5 引用5.1 引用的概念5.2 const 引用5.3 引用的使用场景5.4 引用和指针的区别6 inline 关键字7 nullptr1 域 在 C 中,域包括了函数局部域,全局域…

【Kingbase人大金仓】账号密码重置忘记密码重置

【Kingbase人大金仓】账号密码重置忘记密码重置

2026/8/26 14:46:31

目录 1、停止数据库服务: 2、修改配置文件(修改后可无需密码登录数据库): 3、启动数据库服务: 4、登录数据库: 5、登录数据库之后,执行修改设置账号密码命令: 6、修改配置文件…

DxWrapper 老游戏兼容修复:3 步让 Windows 10/11 重新跑得动老游戏

DxWrapper 老游戏兼容修复:3 步让 Windows 10/11 重新跑得动老游戏

2026/8/26 14:46:31

DxWrapper 老游戏兼容修复:3 步让 Windows 10/11 重新跑得动老游戏 【免费下载链接】dxwrapper Fixes compatibility issues with older games running on Windows 10/11 by wrapping DirectX dlls. Also allows loading custom libraries with the file extension .asi into g…

如何在Neptune Mutual报告保险事故:Incident Report与Dispute争议完整用户指南

如何在Neptune Mutual报告保险事故:Incident Report与Dispute争议完整用户指南

2026/8/26 14:46:31

如何在Neptune Mutual报告保险事故:Incident Report与Dispute争议完整用户指南 【免费下载链接】app.neptunemutual.com 🔱 An open source interface for the Neptune Mutual App 项目地址: https://gitcode.com/gh_mirrors/ap/app.neptunemutual.com…

Simple Live 完整上手指南:一个 App 看遍 B站、抖音、虎牙、斗鱼的直播

Simple Live 完整上手指南:一个 App 看遍 B站、抖音、虎牙、斗鱼的直播

2026/8/26 14:46:31

Simple Live 完整上手指南:一个 App 看遍 B站、抖音、虎牙、斗鱼的直播 【免费下载链接】dart_simple_live 简简单单的看直播 项目地址: https://gitcode.com/GitHub_Trending/da/dart_simple_live 看直播的人大概都经历过这样的烦恼:B站、抖音、…

网络工程师注意:Netmiko批量管理设备,3小时变3分钟

网络工程师注意:Netmiko批量管理设备,3小时变3分钟

2026/8/26 14:36:31

每天你是否还仍旧在以手动这种方式SSH登录几十台设备, 一条一条、逐个逐个地去敲命令? 熬夜进行巡检的活动, 对配置进行批量修改, 只要手抖那么一下, 就都得重新再来一次。正好有个兄弟!他就是个例子, 上周的时候他向我吐槽, 为怎么样去改三百台交换机的VLAN, 加班…

[光学原理与应用-521]:对光的错误理解与纠偏

[光学原理与应用-521]:对光的错误理解与纠偏

2026/8/26 1:50:39

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

SIP通话转接原理与REFER方法实战解析

SIP通话转接原理与REFER方法实战解析

2026/8/26 1:49:16

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

2026/8/24 21:16:09

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

Python random 模块常用函数详解:从入门到实战

Python random 模块常用函数详解:从入门到实战

2026/8/26 0:05:45

目录 1. 引言2. 准备工作3. 基础随机函数4. 序列相关函数5. 随机种子与复现6. 实战案例7. 注意事项8. 常见问题与排查9. 总结 1. 引言 摘要: 本文系统介绍 Python 标准库 random 模块中最常用的随机数生成函数。内容涵盖基础随机函数(random()、unifor…

Hermes接入团队协作后,我推翻了三个效率假设

Hermes接入团队协作后,我推翻了三个效率假设

2026/8/26 0:05:45

聊《Hermes真能提效吗?先看流程里最慢的那一步》之前,先说一句实在的:别急着背概念,先看它在真实项目里到底解决什么问题。摘要团队把 Hermes 接进项目三个月后,交付速度没有提升反而慢了。复盘后发现,最先…

免费AI大模型调教指南:打造专属网文写作助手

免费AI大模型调教指南:打造专属网文写作助手

2026/8/26 0:05:45

1. 先搞清楚“AI小说扩展模式”到底能帮你做什么如果你是一个刚开始写网文、或者卡在L3级别以下的作者,最头疼的可能是情节推进不下去、人物对话干瘪,或者世界观设定不够丰满。自己对着空白文档硬憋,效率很低。这时候,一个能理解你…

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

2026/8/22 2:02:26

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…

导师推荐!2026最新AI论文工具测评与实用推荐

导师推荐!2026最新AI论文工具测评与实用推荐

2026/8/22 4:13:47

2026年真正好用的AI论文工具,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

告别游戏崩溃:XCOM 2模组管理器的智能革命

告别游戏崩溃:XCOM 2模组管理器的智能革命

2026/8/22 1:32:34

告别游戏崩溃:XCOM 2模组管理器的智能革命 【免费下载链接】xcom2-launcher The Alternative Mod Launcher (AML) is a replacement for the default game launchers from XCOM 2 and XCOM Chimera Squad. 项目地址: https://gitcode.com/gh_mirrors/xc/xcom2-lau…