MiniCPM-o-2_6架构全解:SigLIP、Whisper、ChatTTS与Qwen2.5如何组成端到端8B模型?

发布时间:2026/8/23 11:42:41

MiniCPM-o-2_6架构全解:SigLIP、Whisper、ChatTTS与Qwen2.5如何组成端到端8B模型?
MiniCPM-o-2_6架构全解SigLIP、Whisper、ChatTTS与Qwen2.5如何组成端到端8B模型【免费下载链接】MiniCPM-o-2_6项目地址: https://ai.gitcode.com/OpenBMB/MiniCPM-o-2_6MiniCPM-o-2_6 是 OpenBMB 开源的端到端 8B 全模态多模态大模型它将 SigLIP-400M 视觉编码器、Whisper-medium-300M 语音编码器、ChatTTS-200M 语音合成模块与 Qwen2.5-7B 语言主干焊在同一个模型里一张图、一段话、一段声音都能理解还能用可配置的声音实时对话。这篇文章带你用最少代码、最多直觉彻底搞懂它的架构组成。 先记结论8B 参数 4 个模块拼出来的MiniCPM-o-2_6 不是一个单塔模型而是4 个成熟小模型端到端联合训练的产物组件参数量角色项目中的位置SigLIP 视觉编码器约 400M看图图像/视频帧编码modeling_navit_siglip.pyWhisper-medium 语音编码器约 300M听音语音/音频特征提取config.json中audio_configQwen2.5-7B 语言模型约 7B大脑推理与生成config.json主干参数ChatTTS 语音合成器约 200M说话文本→语音config.json中tts_config合计约 8B端到端联合训练—关键点这四个模块不是调用链而是可微分地连在一起输入和输出都能接收/生成图像、音频和文本any-to-any。️ 组件一SigLIP-400M Perceiver 重采样器视觉通路视觉侧由两部分构成SigLIP 编码器27 层、hidden_size1152、patch_size14负责把图像切成 patch 后提取特征。实现见modeling_navit_siglip.py它采用 NaViT 式动态分辨率方案——支持任意宽高比、最高 1.8M 像素如 1344×1344的图像图像切片逻辑在image_processing_minicpmv.py中最多 9 片。Perceiver 重采样器Resampler用一个64 个可学习 queryquery_num: 64见config.json从视觉特征中提问把高维特征压缩成固定数量的视觉 token。代码在resampler.py。 这正是它省 token的秘密1.8M 像素的大图只产生约 640 个视觉 token比同类模型少 75% 以上首字延迟、显存和功耗都直接受益。️ 组件二Whisper-medium-300M音频输入通路耳朵是改造版的 Whisper 编码器24 层编码器、d_model1024配置在config.json的audio_config基于openai/whisper-medium自定义的MiniCPMWhisperEncoder在modeling_minicpmo.py中实现加入了流式友好的分块注意力掩码音频按1 秒一个 chunkaudio_chunk_length: 1.0切分特征再按audio_pool_step: 2下采样最后经音频投影层audio_projection_layer映射到 3584 维语言空间效果中文语音识别在 AISHELL-1 上 CER 低至 1.6超过 GPT-4o-Realtime。 组件三Qwen2.5-7B大脑与中枢语言主干就是 Qwen2.5-7B配置一目了然config.jsonhidden_size: 3584、num_hidden_layers: 28、28 个注意力头4 个 KV 头GQA上下文长度32768max_position_embeddings词表 151700视觉/音频 token 和文本 token 共用同一个 Transformer视觉 query、音频特征都投影到 3584 维后与文本一起进入注意力也就是说看图和听音不是外挂能力而是和文字在同一空间里做注意力交互这是端到端架构能理解画面里的人在说什么的基础。 组件四ChatTTS-200M语音输出通路嘴巴是ConditionalChatTTStts_config.model_type: conditional_chatttsllm_dim: 3584与主干对齐实现同样在modeling_minicpmo.py文本先生成语音 tokenGFSQ 量化 4 级码本再经 DVAE 解码成 mel 频谱最终由 Vocos 声码器模型文件assets/Vocos.pt把 mel 还原为 24kHz 波形它额外带一个chattts 专用分词器assets/chattts_tokenizer/和说话人嵌入speaker embedding这个说话人嵌入来自一个巧妙设计系统提示词里可以放一段参考音频作为音频 system prompt从而在推理时自由配置音色、做零样本音色克隆甚至描述造声说像一个魅力男巨星那样说话就能生成对应声线。 四个组件如何焊在一起端到端训练把架构简化成一条数据流就懂了图像 ── SigLIP ── Resampler(64 token) ─┐ 音频 ── Whisper ── 音频投影层 ─────────┼── Qwen2.5-7B ── 文本 token ── ChatTTS ── Vocos ── 语音 文本 ────────────────────────────────────┘ │ ── 语音 token 也可回灌实时对话联合可微梯度能穿过投影层回传到 SigLIP 和 Whisper四个模块在configuration_minicpm.py的MiniCPMOConfig中统一组装、端到端训练流式机制把离线编码器改为在线处理并用时分复用TDM机制把视频流、音频流、文本流按小时间片交织进 LLM 的序列里实现边看边听边说的多模态直播live streaming模型入口类是modeling_minicpmo.py中的MiniCPMO常用方法有chat()单轮/多轮对话、streaming_prefill()/streaming_generate()流式直播、get_sys_prompt()配置音色 项目文件速查表文件作用modeling_minicpmo.py主模型MiniCPMO、Whisper 编码器、ChatTTS、流式 TTSmodeling_navit_siglip.pySigLIP 视觉编码器resampler.pyPerceiver 视觉重采样器configuration_minicpm.py统一配置视觉/音频/TTSprocessing_minicpmo.py多模态 Processor文本图音混合输入image_processing_minicpmv.py动态分辨率图像切片tokenization_minicpmo_fast.py分词器与特殊 token 定义config.json模型超参数总入口model-00001-of-00004.safetensors等 4 个分片模型权重共 4 片assets/Vocos.pt声码器权重assets/demo.wav、assets/Skiing.mp4演示用的参考音频与视频assets/input_examples/各种说话风格示例音频音色克隆、情感、语速等 快速上手三步1. 获取项目git clone https://gitcode.com/OpenBMB/MiniCPM-o-2_6.git2. 安装依赖注意 transformers 版本要求 4.44.2pip install transformers4.44.2 torch2.3.1 librosa soundfile vocos3. 加载并对话最小示例from transformers import AutoModel, AutoTokenizer model AutoModel.from_pretrained( openbmb/MiniCPM-o-2_6, trust_remote_codeTrue, attn_implementationsdpa, torch_dtypetorch.bfloat16) model model.eval().cuda() model.init_tts() # 初始化 TTS 处理器与 Vocos 声码器 tokenizer AutoTokenizer.from_pretrained(openbmb/MiniCPM-o-2_6, trust_remote_codeTrue) res model.chat(msgs[{role:user,content:[描述一下这张图,xx.jpg]}], tokenizertokenizer) print(res)更多用法实时语音对话、音色克隆、多模态直播详见README.md的 Usage 章节。 小提示显存吃紧时可用 int4 量化版约 7GB或 GGUF 格式跑端侧设备。❓ 常见疑问FAQQ1为什么叫端到端因为听→理解→说整条链路是同一个模型可微训练出来的不是ASR 工具 LLM TTS 工具的拼接音高、情感、语气能直接参与推理。Q28B 参数具体怎么分配的约 7B 在 Qwen2.5 语言主干约 400M 在 SigLIP约 300M 在 Whisper约 200M 在 ChatTTS另加少量投影层——总和正好 8B手机/单卡可跑。Q3只用视觉/只用语音行不行可以。加载时设置init_audioFalse, init_ttsFalse即得到纯视觉模型用法与 MiniCPM-V 系列一致音频相关功能会随配置自动跳过。写在最后MiniCPM-o-2_6 的架构哲学一句话用小模块做专业事用端到端训练让它们变成整体。SigLIP 负责看得细高 token 密度、Whisper 负责听得准、Qwen2.5 负责想得清、ChatTTS 负责说得像再加上 TDM 流式机制和可配置音频系统提示词就得到了一个 8B 身材、GPT-4o 级别视觉理解、开源最强实时语音对话的全模态模型。【免费下载链接】MiniCPM-o-2_6项目地址: https://ai.gitcode.com/OpenBMB/MiniCPM-o-2_6创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

企业招聘困境解析与高效招聘策略

企业招聘困境解析与高效招聘策略

2026/8/23 11:42:41

1. 招聘困境的本质解析"招不到人"这个表面现象背后,实际上是企业需求与市场供给的结构性错配。根据我十年人力资源咨询经验,企业招聘漏斗从职位发布到offer接受的转化率通常不足15%,而其中真正能通过试用期的可能只有30%。这意味着…

如何快速上手DebugKit:5分钟安装并跑出悬浮调试面板的完整教程

如何快速上手DebugKit:5分钟安装并跑出悬浮调试面板的完整教程

2026/8/23 11:32:41

如何快速上手DebugKit:5分钟安装并跑出悬浮调试面板的完整教程 【免费下载链接】debugkit Ever hid debug functions in your UI? Here is now a clean way to do it! 项目地址: https://gitcode.com/gh_mirrors/de/debugkit 还在把调试按钮藏在 App 界面里…

API Firewall集成ModSecurity与OWASP CRS:为API加一道WAF防线的完整指南

API Firewall集成ModSecurity与OWASP CRS:为API加一道WAF防线的完整指南

2026/8/23 11:32:41

API Firewall集成ModSecurity与OWASP CRS:为API加一道WAF防线的完整指南 【免费下载链接】api-firewall Fast and light-weight API proxy firewall for request and response validation by OpenAPI specs. 项目地址: https://gitcode.com/gh_mirrors/ap/api-fi…

Qwen3.6-27B-AWQ-INT4:把 27B 模型权重显存压到约 1/4 的量化方案

Qwen3.6-27B-AWQ-INT4:把 27B 模型权重显存压到约 1/4 的量化方案

2026/8/23 14:03:04

Qwen3.6-27B-AWQ-INT4:把 27B 模型权重显存压到约 1/4 的量化方案 【免费下载链接】Qwen3.6-27B-AWQ-INT4 项目地址: https://ai.gitcode.com/hf_mirrors/cyankiwi/Qwen3.6-27B-AWQ-INT4 Qwen3.6-27B-AWQ-INT4 是 Qwen3.6-27B 的 INT4 量化版:用…

在 macOS 上安装 IINA 的 3 种方式与首次设置清单

在 macOS 上安装 IINA 的 3 种方式与首次设置清单

2026/8/23 14:03:04

在 macOS 上安装 IINA 的 3 种方式与首次设置清单 【免费下载链接】iina The modern video player for macOS. 项目地址: https://gitcode.com/gh_mirrors/iin/iina QuickTime 能打开的格式很有限,macOS 上大多数视频要靠第三方播放器接手,IINA 是…

Testcontainers一键拉起Radarr、Sonarr、Jellyfin全家桶:Janitorr本地开发环境完全指南

Testcontainers一键拉起Radarr、Sonarr、Jellyfin全家桶:Janitorr本地开发环境完全指南

2026/8/23 14:03:04

Testcontainers一键拉起Radarr、Sonarr、Jellyfin全家桶:Janitorr本地开发环境完全指南 【免费下载链接】janitorr Cleans your Radarr, Sonarr, Jellyseerr and Jellyfin before you run out of space 项目地址: https://gitcode.com/gh_mirrors/ja/janitorr …

如何从零跑通 PyMAF:环境配置与 SMPL 模型数据准备完整教程

如何从零跑通 PyMAF:环境配置与 SMPL 模型数据准备完整教程

2026/8/23 14:03:04

如何从零跑通 PyMAF:环境配置与 SMPL 模型数据准备完整教程 【免费下载链接】PyMAF [ICCV 2021, Oral] PyMAF: 3D Human Pose and Shape Regression with Pyramidal Mesh Alignment Feedback Loop 项目地址: https://gitcode.com/gh_mirrors/py/PyMAF PyMAF …

DNS-Challenge 深度降噪实战手册:从零搭建语音增强数据与评估流水线

DNS-Challenge 深度降噪实战手册:从零搭建语音增强数据与评估流水线

2026/8/23 14:03:04

DNS-Challenge 深度降噪实战手册:从零搭建语音增强数据与评估流水线 【免费下载链接】DNS-Challenge This repo contains the scripts, models, and required files for the Deep Noise Suppression (DNS) Challenge. 项目地址: https://gitcode.com/gh_mirrors/…

PersonaLive 上手指南:5 分钟装好实时人像动画系统,1 张肖像图生成无限直播流

PersonaLive 上手指南:5 分钟装好实时人像动画系统,1 张肖像图生成无限直播流

2026/8/23 13:53:03

PersonaLive 上手指南:5 分钟装好实时人像动画系统,1 张肖像图生成无限直播流 【免费下载链接】PersonaLive [CVPR 2026] PersonaLive! : Expressive Portrait Image Animation for Live Streaming 项目地址: https://gitcode.com/GitHub_Trending/pe/…

[光学原理与应用-521]:对光的错误理解与纠偏

[光学原理与应用-521]:对光的错误理解与纠偏

2026/8/23 0:02:09

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

SIP通话转接原理与REFER方法实战解析

SIP通话转接原理与REFER方法实战解析

2026/8/23 0:02:09

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

2026/8/23 0:02:09

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

[光学原理与应用-521]:对光的错误理解与纠偏

[光学原理与应用-521]:对光的错误理解与纠偏

2026/8/23 0:02:09

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

SIP通话转接原理与REFER方法实战解析

SIP通话转接原理与REFER方法实战解析

2026/8/23 0:02:09

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

2026/8/23 0:02:09

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

2026/8/22 2:02:26

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…

导师推荐!2026最新AI论文工具测评与实用推荐

导师推荐!2026最新AI论文工具测评与实用推荐

2026/8/22 4:13:47

2026年真正好用的AI论文工具,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

告别游戏崩溃:XCOM 2模组管理器的智能革命

告别游戏崩溃:XCOM 2模组管理器的智能革命

2026/8/22 1:32:34

告别游戏崩溃:XCOM 2模组管理器的智能革命 【免费下载链接】xcom2-launcher The Alternative Mod Launcher (AML) is a replacement for the default game launchers from XCOM 2 and XCOM Chimera Squad. 项目地址: https://gitcode.com/gh_mirrors/xc/xcom2-lau…