LLM的层数和参数分布

发布时间:2026/7/24 15:22:01

LLM的层数和参数分布
当前2025–2026主流 LLM 已高度收敛到Decoder-only Transformer但在超大参数区间普遍改用MoE混合专家​ 来把“总参数”和“激活参数”解耦。下面按「层数构成 → 参数分布规律 → 代表模型实测」三层说清楚。一、网络层数的典型构成Dense 与 MoE 通用骨架一个标准 Decoder-only Block以 LLaMA / Qwen / DeepSeek 系为例顺序是Input → Token Embedding → [ RMSNorm → Self-Attn(GQA/RoPE) → Res → RMSNorm → FFN/SwiGLU → Res ] × N → Final RMSNorm → LM Head通常与 Embedding 共享权重层数 L7B 级约 28–36 层70B 级约 80 层超大规模 60–126 层。Attention现代全系RoPE GQAKV head 数远小于 Q head 数DeepSeek 系用MLA低秩压缩 KV。FFNLLaMA-2 时代是 ReLU-FFNLLaMA-3/Qwen3/DeepSeek 全是SwiGLUgate/up/down 三个矩阵。MoE 变体把部分层的 SwiGLU 换成“多个专家 FFN Router”Attention 仍共享DeepSeek-V3 前 3 层是 Dense FFN后 58 层是 MoE256 路由 1 共享激活 81。经验区间hidden_dim d 与层数 L 大致满足参数≈12·L·d²Dense 近似所以 7B≈32×4096² 量级70B≈80×8192² 量级。二、参数分布“FFN 占 2/3” 是 Dense 模型的铁律对 Dense 模型LLaMA-3 / Qwen3-Dense / GPT-3 类以 LLaMA-7Bd4096, L32, I11008为例拆开看组件公式参数量占比Token EmbeddingV×d (32000×4096)128M~2%Attention32层L×4d²2.05B~30%FFN/SwiGLU32层L×3·d·I4.22B~63%​RMSNorm 偏置可忽略0.5%1%LM Head与 Embedding 共享00%通用比例1B–400B Dense 都成立Embedding/LM Head1–3%大词表如 Qwen 151K 会略高Attention含 Q/K/V/O25–30%FFN/SwiGLU60–68%Norm 等1%之所以 FFN 占大头是因为经典 FFN 中间维I≈4dSwiGLU 下I≈8d/3单层 FFN 参数量3·d·I ≈ 8d²而 Attention 只有4d²比例稳定 2:1。三、MoE 模型总参数 vs 激活参数的分布彻底分化MoE 不改变“单层结构”只是把 FFN 复制成 E 个专家因此静态总参数里 FFN 占比飙到 85–95%但单 token 激活参数分布仍接近 Dense 比例。以DeepSeek-V3671B 总 / 37B 激活61 层d7168为例激活参数 37B 的内部切分Attention61 层共享~11.4B →31%路由专家58 层 × 激活 8 个~20.4B →56%共享专家58 层 × 1~2.5B → 7%Dense FFN前 3 层~1.2B → 3%LM Head~0.9B → 2.5%总参数 671B 里256×58 个路由专家权重几乎全是“躺着的 FFN”FFN 类权重占比90%Attention 只占 ~5%Embedding/LM Head ~1.5%。其他代表模型2025–2026 在役模型架构层数总/激活专家设置LLaMA-3 8BDense328B / 8B–LLaMA-3 70BDense8070B / 70BGQA-8LLaMA-3.1 405BDense126405B / 405BGQA-8, d16384Qwen3-32BDense6432B / 32BGQA-8Qwen3-235B-A22BMoE94235B / 22B128 专家, top-8DeepSeek-V3MoEMLA61671B / 37B2561 共享, top-8Mixtral 8×22BMoE56141B / 39B8 专家, top-2四、一句话抓重点层数小模型 28–36中模型 64–80超大 Dense 126超大 MoE 60 上下但每层更宽。构成RoPE GQA/MQA/MLA SwiGLU FFN RMSNormLM Head 与 Embedding 通常共享。Dense 参数分布FFN ≈ 2/3Attention ≈ 1/3Embedding 忽略不计。MoE 参数分布总参数里 FFN 专家占 90%但每 token 激活的 37B/22B 里FFN 仍约 60–65%和 Dense 推理时的计算分布一致。下面把上文里出现的英文单词、缩写、公式符号全部摊开成中文解释按出现顺序归类方便对照回看。五、模型与架构名LLMLarge Language Model大语言模型。Decoder-only Transformer只用“解码器”部分的 Transformer 架构GPT 系、Llama 系都是这种不像原始 Transformer 那样有编码器解码器。Dense稠密模型。每一层的所有参数对每个 token 都参与计算。MoEMixture of Experts混合专家。把 FFN 换成多个“专家”一个路由器每次只激活其中几个总参数大但激活参数小。LLaMA / LlamaMeta 出的开源模型系列Llama-3 等。Qwen阿里通义千问的模型系列Qwen3 等。DeepSeek深度求索公司的模型系列V3、R1 等。GPT-3OpenAI 早期稠密大模型。MixtralMistral AI 出的 MoE 模型8×22B 指 8 个专家每次用 2 个。六、层结构与算子缩写BlockTransformer 的一个重复单元一层。RMSNormRoot Mean Square Normalization均方根归一化比 LayerNorm 简单Llama/Qwen/DeepSeek 都用它。Self-AttnSelf-Attention自注意力。GQAGrouped Query Attention分组查询注意力。把 Q 分成几组共享同一份 K/V省显存如 GQA-8 8 组。MQAMulti-Query Attention多查询注意力极端版 GQA所有 Q 共享 1 份 K/V。MLAMulti-head Latent Attention多头潜在注意力DeepSeek 用把 K/V 压缩到低维潜空间再展开省内存。RoPERotary Position Embedding旋转位置编码用旋转矩阵把位置信息融进 Q/K。ResResidual残差连接输出 子层(x) x。FFNFeed-Forward Network前馈神经网络Transformer 里每个 Block 后半段那个“升维再降维”的网。SwiGLU一种 FFN 激活组合Swish GLU比老式 ReLU FFN 效果好内部有 gate/up/down 三个矩阵。ReLU-FFN用 ReLU 做激活的老式前馈网络Llama-2 之前常见。LM Head语言模型输出头把最后隐藏向量映射到词表概率权重常和 Embedding 共享。Embedding词嵌入矩阵把 token id 变成向量。RouterMoE 里的路由函数决定当前 token 送进哪几个专家。Expert专家MoE 中替代原 FFN 的其中一个前馈子网络。Shared Expert共享专家MoE 里所有 token 都会过的那个专家DeepSeek 用。Top-k路由器每次选 k 个专家top-8 选 8 个。七、公式与维度符号L层数number of layers。d / hidden_dim隐藏维度每个 token 向量的长度如 4096、8192。I / 中间维FFN 中间层维度经典 Transformer 里 I ≈ 4dSwiGLU 里 I ≈ 8d/3。V词表大小vocab size如 32000、151000。Q/K/V/OQuery / Key / Value / Output 四个注意力矩阵。KV headK 和 V 的头数GQA 下比 Q head 少。参数≈12·L·d²Dense 模型粗略估算式——Attn 占 4Ld²FFN(SwiGLU) 占 8Ld²合起来 12Ld²忽略 embedding 等。总参数 / 激活参数MoE 里“总参数”是所有专家权重加起来“激活参数”是单 token 实际经过的参数量决定推理算力。八、具体数字里的写法8×22BMixtral8 个专家每个专家约等于 22B 级别 FFN总 141B激活 39B。235B-A22BQwen3 MoE总 235B激活 22B。671B / 37BDeepSeek-V3总 671B激活 37B。2561 共享, top-8256 个路由专家 1 个共享专家每次路由选 8 个路由专家 必过共享专家。前 3 层 Dense后 58 层 MoEDeepSeek-V3 共 61 层浅层不用 MoE深层才切专家。

相关新闻

LTC4366IDDB-2#TRPBF在高压DC配电与航空电子中的浪涌保护应用

LTC4366IDDB-2#TRPBF在高压DC配电与航空电子中的浪涌保护应用

2026/7/24 15:22:01

LTC4366IDDB-2#TRPBF:ADI高压浪涌抑制器详解在工业控制、汽车电子和航空电子等高可靠性应用场景中,供电系统面临着严酷的高压瞬态冲击——汽车电源线上的负载突降可能产生高达上百伏的电压尖峰,工业环境中的电机启停也会引发剧烈的电压波动。…

ADI LTC3779IFE#TRPBF:150V四开关同步升降压控制器技术规格与设计参考

ADI LTC3779IFE#TRPBF:150V四开关同步升降压控制器技术规格与设计参考

2026/7/24 15:22:01

LTC3779IFE#TRPBF:ADI 150V高压四开关同步升降压控制器深度解析在汽车电子、工业控制、电信设备和军用系统等高可靠性应用中,电源系统常常面临输入电压大幅波动的挑战——12V系统可能出现高达60V甚至更高的电压瞬变,而48V或更高电压的总线系统…

从芯片手册到真实性能:高性能SAR ADC评估板实战指南

从芯片手册到真实性能:高性能SAR ADC评估板实战指南

2026/7/24 15:12:00

1. 项目概述:从芯片手册到真实性能,如何用好一款高性能SAR ADC评估板 在精密数据采集系统的设计初期,我们手里往往只有一份几十页甚至上百页的芯片数据手册。手册上那些令人心动的参数——比如16位分辨率、1MSPS采样率、高达90dB的信噪比&…

PCM5242音频DAC寄存器配置与时钟系统深度解析

PCM5242音频DAC寄存器配置与时钟系统深度解析

2026/7/24 16:12:03

1. PCM5242音频DAC:从寄存器到时钟的深度配置指南在音频硬件设计领域,德州仪器的PCM5242是一款被广泛应用的立体声音频数模转换器(DAC)。它集成了高性能的Delta-Sigma调制器、片上数字滤波器以及灵活的时钟管理单元,常…

JetBrains IDE试用期重置终极指南:如何快速解决开发工具过期问题

JetBrains IDE试用期重置终极指南:如何快速解决开发工具过期问题

2026/7/24 16:12:03

JetBrains IDE试用期重置终极指南:如何快速解决开发工具过期问题 【免费下载链接】ide-eval-resetter 项目地址: https://gitcode.com/gh_mirrors/id/ide-eval-resetter 你是否曾经因为JetBrains IDE试用期到期而中断了重要的开发工作?ide-eval-…

Unity程序化树木建模:Broccoli Tree Creator节点化工作流与性能优化指南

Unity程序化树木建模:Broccoli Tree Creator节点化工作流与性能优化指南

2026/7/24 16:12:03

1. 项目概述:当程序化建模遇见自然之美 在游戏开发,尤其是那些追求宏大世界观的开放世界、RTS(即时战略)或大型RPG项目中,自然环境的构建一直是个既迷人又头疼的难题。想象一下,你需要一片绵延数公里的森林…

LangGraph中的Reducer是什么

LangGraph中的Reducer是什么

2026/7/24 16:12:03

Reducer(归约器)是一个函数,它定义了“当多个节点都想修改同一个 State 字段时,如何把这些修改合并成一个最终结果”。或者说:Reducer 决定了 State 中某个字段的更新策略——是覆盖?是追加?是累…

终极碧蓝航线自动化工具:3步配置解放你的游戏时间

终极碧蓝航线自动化工具:3步配置解放你的游戏时间

2026/7/24 16:12:03

终极碧蓝航线自动化工具:3步配置解放你的游戏时间 【免费下载链接】AzurLaneAutoScript Azur Lane bot (CN/EN/JP/TW) 碧蓝航线脚本 | 无缝委托科研,全自动大世界 项目地址: https://gitcode.com/gh_mirrors/az/AzurLaneAutoScript AzurLaneAutoS…

AI驱动制造业质量管理的技术架构与实践

AI驱动制造业质量管理的技术架构与实践

2026/7/24 16:02:02

1. 项目背景与核心价值在制造业数字化转型浪潮中,质量管理一直是企业核心竞争力的关键环节。过去三年间,我作为AI解决方案架构师深度参与了12家大型制造企业的质量管理系统改造,发现传统质量管控存在三个致命痛点:第一是问题发现滞…

微服务进阶:服务网格与Istio

微服务进阶:服务网格与Istio

2026/7/24 4:17:29

541|微服务进阶:服务网格与Istio 上篇文章我们聊了微服务的基本概念和拆分方法。 但微服务多了,问题也多了: 服务之间怎么通信? 怎么监控每个服务的调用链路? 熔断、限流、重试怎么做? 安全认证怎么统一? 以前这些都靠SDK库(比如Hystrix、Feign),每个服务都要集成…

零售超级终端全域协同:ShareKit 碰一碰商品流转业务落地案例

零售超级终端全域协同:ShareKit 碰一碰商品流转业务落地案例

2026/7/23 4:40:05

一、零售门店全域协同业务背景与行业痛点 1.1 门店超级终端设备矩阵(连锁便利店/商超标准配置) 自助收银Kiosk一体机:顾客结算、自助核销优惠券、商品素材预览;运营折叠平板:店长后台商品上新、图片录入、活动配置、…

噗叽短视频界面分析

噗叽短视频界面分析

2026/7/23 1:54:13

1 和小红书类似,可以采用类似判断方法------------其实他比小红书好判断,因为他没有图片,控件位置几乎是固定的,都不用判断------------2 因为他没有点赞按钮------------而且几乎所有控件位置都是完全一样的,所以我就…

Django毕设项目:基于 Django 的 智能化学生综合素质测评审核系统 校园学生评优评奖综合管理系统(源码+文档,讲解、调试运行,定制等)

Django毕设项目:基于 Django 的 智能化学生综合素质测评审核系统 校园学生评优评奖综合管理系统(源码+文档,讲解、调试运行,定制等)

2026/7/24 0:01:07

博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于Java、小程序技术领域和毕业项目实战 ✌️技术范围:&am…

[具身智能-634]:Python 封装的地平线 VIO 多媒体库:libsrcampy库详解

[具身智能-634]:Python 封装的地平线 VIO 多媒体库:libsrcampy库详解

2026/7/24 0:01:07

srcampy /libsrcampy 名称释义先明确结论: 官方文档没有公布标准化英文全称,是地平线内部项目缩写;行业公认拆解如下:srcampy Source Amplifier Python bindingsrc Source(图像源:MIPI Sensor、视频源&am…

用Highcharts 创建可拖拽三维散点立方体3D图表

用Highcharts 创建可拖拽三维散点立方体3D图表

2026/7/24 0:01:07

该案例基于Highcharts scatter3d 三维散点图实现空间立方体散点可视化,核心特色:三维 X/Y/Z 三轴空间,所有散点分布在 0~10 立方体空间内;散点使用径向渐变实现立体 3D 圆球质感;支持鼠标 / 触屏拖拽画布,…