LaCo: Large Language Model Pruning via Layer Collapse 解读

发布时间:2026/7/23 22:41:04

LaCo: Large Language Model Pruning via Layer Collapse 解读
一、论文基本信息论文题目LaCo: Large Language Model Pruning via Layer Collapse作者Yifei Yang、Zouying Cao、Hai Zhao发表Findings of EMNLP 2024方法名称LaCoLayer Collapse论文代码作者公开了官方实现目前主要以 LLaMA2 和 Baichuan2 的 Jupyter Notebook 为主仓库也说明代码仍是初步版本尚未封装成通用剪枝工具。一句话概括LaCo 不直接删除冗余层也不训练新的小模型而是先把若干连续后续层的“参数差异”累加到前面的一个层中再删除这些后续层以此把多个 Transformer 层折叠成一个层。它属于训练后、层级结构化剪枝、深度压缩、参数融合式剪枝。二、这篇论文要解决什么问题前面看过的几种 LLM 剪枝路线分别是SparseGPT、Wanda删除单个权重产生非结构化稀疏LLM-Pruner、LoRAPrune、Compresso删除 head、FFN channel、hidden dimensions 等结构Sheared LLaMA同时压缩深度和宽度再继续预训练ShortGPT根据层输入输出相似性直接删除完整 Transformer 层。LaCo 关注的是一个更具体的问题如果多个相邻 Transformer 层高度相似能不能不把它们直接丢掉而是把它们包含的参数变化合并进一个保留层中直接删层虽然简单但被删除层中学习到的信息也完全消失。LaCo 希望通过层折叠保留一部分被删层的参数信息同时得到层数更少的标准稠密模型。作者的动机来自两项观察相邻层对应权重矩阵之间变化较小而且相邻层输出隐藏状态的余弦相似度通常很高。三、LaCo 的核心RDSC Layer MergeLaCo 首先提出Reserving-Differences-while-Seeking-Common Layer MergeRDSC 层合并。假设第 l 层参数为其后有 m 个连续层LaCo 先计算每个后续层相对于第 (l) 层的参数差异然后把这些差异累加到第 (l) 层合并完成后后面的 m个层被删除只留下参数更新后的第 l 层。论文分别对 Self-Attention 和 MLP 中形状对应的参数执行该操作。四、用一个简单例子理解 Layer Collapse假设要把连续四层折叠成一层。LaCo 计算然后删除最终四层变成一层。这里必须注意LaCo 不是简单平均这四层参数。它也不是直接保留其中某一层更不是知识蒸馏。它把第 (l) 层看成多个相邻层之间的“共同基准”再把其他层相对该基准的差异累积起来。因此作者称其为Seeking Common保留共同的基准层Reserving Differences累加其他层相对基准层的差异。五、这个参数合并为什么可能有效LaCo 的动机有两部分。1. 相邻层参数相近论文比较了 LLaMA2-7B 和 Baichuan2-7B 相邻层中 Q、K、V、MLP up/down 矩阵的差异。作者观察到在数千万参数的大矩阵中相邻层对应参数整体变化相对有限。2. 相邻层表示高度相似作者用 Wikipedia 句子前向推理计算相邻层输出隐藏状态的余弦相似度。LLaMA2-7B 和 Baichuan2-7B 的第 3 至第 28 层之间相邻层输出相似度普遍接近 1。作者还把第 10 至第 19 层按每四层折叠为一层折叠前后的最终表示余弦相似度最低仍高于0.996。这表明至少在少量校准文本上参数差异合并可以较好地保持最终隐藏表示。但这只是经验依据并不是严格证明。函数复合并不等于参数相加后面会详细讨论这一局限。六、LaCo 不是盲目合并而是边合并边验证仅凭参数相似就直接折叠大量层风险很高因此 LaCo 在每次候选合并后都会检查折叠模型的最终隐藏表示是否仍然与原始模型足够相似它需要五个主要设置符号含义(C)每次参与折叠的连续层数([L,H])允许执行折叠的层范围(I)两次成功折叠之间的最小层间隔(D)少量校准句子(T)折叠模型与原模型的表示相似度阈值对一个候选折叠模型LaCo 分别运行原模型和候选模型取得最后一层输出隐藏状态计算两者在校准句子上的平均余弦相似度。相似度 (sT)接受本次折叠相似度 (s\leq T)拒绝本次折叠换一个位置继续尝试。这相当于给参数合并加了一道输出层面的安全检查。七、完整算法流程LaCo 从较高层向较低层扫描因为作者希望把后面的层折叠进前面的层。具体流程如下原始模型复制为当前模型 (M^*)。从允许范围的高层位置开始。选择当前层 (l)尝试把其后的 (C-1) 层折叠到它里面。删除被折叠的后续层形成候选模型 (M_{\text{tmp}})。用少量校准句子分别运行原模型和候选模型。比较两个模型最终隐藏状态的平均余弦相似度。如果超过阈值接受合并并向前移动至少 (I) 层。如果不超过阈值拒绝合并只向前移动一层。重复直到扫描到最低允许层。LaCo 不需要梯度、Hessian、LoRA 或蒸馏。其最坏情况复杂度主要取决于层数和校准句子数。论文以 40 层的 LLaMA2-13B 和 10 条校准句子为例最多只需要处理约 400 次句子前向。八、为什么设置层间隔 (I)假如刚把第 20 至第 23 层折叠成一层接着又立即折叠其相邻层那么两次参数近似误差可能集中在同一区域。因此 LaCo 设置最小间隔 (I)避免连续折叠区域过于密集。它体现了一个重要判断即使每次单独折叠都能通过表示相似度检查多个相邻折叠操作的误差仍可能叠加。论文主实验通常设置 (I2)并针对不同模型选择不同的 (C) 和相似度阈值 (T)。九、相似度阈值如何控制剪枝率LaCo 不能像 Wanda 那样直接指定“剪掉 30% 权重”它通过阈值 (T) 间接控制压缩程度。阈值高要求折叠后与原模型非常相似接受的折叠少阈值低允许更大的表示偏差接受的折叠多。在 LLaMA2-7B 上阈值 (T)剩余层数参数剪枝率0.85299.0%0.652327.1%0.451648.0%0.251260.1%但随着阈值下降BoolQ、PIQA 和 HellaSwag 都会明显恶化。(arXiv)所以 LaCo 的实际控制逻辑是不是直接要求删多少而是要求最终表示最多能偏离原模型多少。这比固定剪枝率更符合“功能保持”的目标但也使目标压缩率不容易精确控制。论文将其列为主要局限之一。十、LaCo 剪的到底是什么LaCo 剪的是完整 Transformer layers。每次折叠后多个连续层变成一个层因此它属于Layer-level structured pruning也可以称为Depth compression with parameter fusion剪枝后层数减少参数量减少KV Cache 对应层数减少每个 token 执行的 Transformer block 数减少每个保留层内部的 hidden size、head 数和 FFN intermediate size不变最终仍然是规则的稠密模型不需要稀疏算子。论文所说的“保持模型内部结构”更准确地理解为保留每个 Transformer block 的标准内部维度和算子结构只减少 block 数量。它并不是完全不改变网络结构因为总深度显然发生了变化。十一、实验设置论文主要测试四个基础模型LLaMA2-7BLLaMA2-13BBaichuan2-7BBaichuan2-13B其中 LLaMA2 使用 10 条英文 Wikipedia 句子校准Baichuan2 使用 5 条英文和 5 条中文 Wikipedia 句子。评估覆盖 reasoning、language、knowledge、examination 和 understanding 五类能力并同时包含基于困惑度和直接生成的任务。基线主要包括LLM-PrunerSliceGPT二者都属于结构化压缩方法。十二、主要实验结果LLaMA2-7B方法参数剪枝率 / 剩余层数平均分相对性能Dense0% / 3246.55100%LLM-Pruner27.0% / 3232.3667.79%SliceGPT26.4% / 3231.8767.37%LaCo27.1% / 2337.4680.28%LLaMA2-13B方法参数剪枝率 / 剩余层数平均分相对性能Dense0% / 4055.50100%LLM-Pruner24.4% / 4036.1965.87%SliceGPT23.6% / 4034.9761.78%LaCo24.6% / 3047.5585.21%Baichuan2Baichuan2-7B 在约 24.2% 剪枝下保留73.26%的平均性能Baichuan2-13B 在约 24.7% 剪枝下保留87.94%。四个模型中有三个模型在约 25%–30% 压缩后保留了超过 80% 的平均任务性能。十三、生成任务上的稳定性论文特别强调了 CHID、XSum 和 WSC generation 等生成式评估。LLM-Pruner 和 SliceGPT 在部分生成任务中会出现无意义重复个别结果甚至为 0LaCo 的生成结果相对稳定。作者认为这是因为 LaCo 没有直接丢弃所有被删除层的信息而是把参数差异融入保留层中。但这并不意味着 LaCo 对生成完全无损。例如 LLaMA2-13B 的 XSum 分数仍从23.56降至14.45说明层折叠依然会明显损害部分生成能力。因此更准确的评价是LaCo 比直接删除内部结构更不容易生成崩溃但并不能无损保留生成能力。十四、困惑度结果并不算接近无损在 LLaMA2-7B 约 27% 剪枝率下方法PPLDense4.46LaCo13.93LLM-Pruner17.30SliceGPT14.51LaCo 确实优于两个结构化剪枝基线但与原始模型相比困惑度仍从4.46 上升到 13.93。这是理解论文时必须注意的一点LaCo 的“保持性能”主要是相对于其他高比例结构化剪枝方法而不是相对于原模型几乎无损。它在多个选择题和分类式任务上保持较好但基础语言建模能力已经发生明显退化。十五、剪枝速度、显存和推理速度在单张 A100 上对 LLaMA2-7B 做约 27% 剪枝时论文报告方法核心剪枝时间LaCo14.7 秒LLM-Pruner15.9 秒SliceGPT313 秒该时间不包括模型加载、数据加载和模型保存只统计核心剪枝过程。在 LLaMA2-13B 上方法显存占用推理速度Dense25,902 MB29.98 token/sLLM-Pruner19,874 MB27.15 token/sSliceGPT22,506 MB35.16 token/sLaCo19,422 MB38.65 token/sLaCo 相比原模型大约减少四分之一显存并将吞吐从 29.98 提升到 38.65 token/s。由于它直接减少完整层数推理仍使用普通 dense kernels不存在非结构化稀疏无法利用的问题。十六、剪枝后是否还需要训练LaCo 的基本版本是无需训练的。但作者额外研究了 post-training以验证折叠模型是否真正继承了原模型的参数基础。作者分别对剪枝后的 LLaMA2-7B 和 Baichuan2-7B 做全参数继续训练LLaMA2-7B约 1B tokens4 张 A100 80GB约 28 小时Baichuan2-7B约 1.25B tokens4 张 A100 80GB约 35 小时。两者训练 loss 都很快下降并趋于稳定说明折叠模型确实继承了一部分原模型能力。不过任务结果并非都提升LLaMA2-7B 平均分由37.46 提升到 40.33Baichuan2-7B 平均分反而由41.79 降至 40.46。作者将后者归因于继续训练数据和 Baichuan2 原始预训练数据分布不匹配。这说明LaCo 可以快速恢复但恢复效果高度依赖继续训练数据的规模和分布。十七、不同压缩率下的表现LaCo 在 LLaMA2-13B 上的结果比较清晰剪枝率 / 剩余层数平均分0% / 4055.5014.6% / 3453.8924.7% / 3047.5549.7% / 2038.27轻度剪枝约 15% 时性能下降很小达到 25% 左右后仍然可用剪掉接近一半参数时平均性能只保留约 69%。LLaMA2-7B 也表现出类似趋势。因此 LaCo 比较合理的工作区间是约 10%–30% 的层级压缩。接近 50% 时模型虽然没有完全崩溃但语言、知识和推理能力均会明显下降。十八、LaCo 和 ShortGPT 的核心区别这两篇论文都做完整层压缩但机制完全不同。对比项ShortGPTLaCo层重要性依据层输入输出余弦变化候选折叠模型与原模型最终表示相似度被删层如何处理直接删除参数差异合并到前一层是否保留被删层信息基本不保留尝试通过参数融合保留剪枝搜索按 BI 全局排序从高层向低层逐步尝试输出模型更浅的 dense 模型更浅的 dense 模型是否需要训练否否可以把二者理解为ShortGPT低影响层直接拿掉LaCo把连续层压缩进一个代表层。因此 LaCo 更接近layer merging / layer fusion而 ShortGPT 更接近传统layer dropping。十九、LaCo 和其他 LLM 剪枝方法的区别与 SparseGPT、WandaSparseGPT、Wanda 删除单个权重矩阵形状和模型深度不变LaCo 删除完整层直接缩短模型深度。因此SparseGPT/Wanda非结构化权重稀疏LaCo层级结构化剪枝。与 LLM-Pruner、LoRAPruneLLM-Pruner 和 LoRAPrune 删除 head、FFN channel 等内部结构保留原始深度LaCo 保留每层内部宽度但删除大量完整层。前者属于宽度剪枝LaCo 更偏深度压缩。与 Sheared LLaMASheared LLaMA 会剪 layer、head、hidden dimension、FFN dimension并继续预训练 50B tokens。LaCo 只折叠层基本版本无需训练。Sheared LLaMA 更适合生产高质量小型 base modelLaCo 更适合快速压缩已有模型。与 CompressoCompresso 需要 LoRA、可学习 L0 mask、instruction tuning 和提示协同LaCo 只需要少量句子前向校准。LaCo 的成本远低但对复杂能力的恢复能力也更有限。二十、方法优点第一剪枝过程简单、速度快。只涉及参数减法、参数加法和少量前向相似度评估。第二不需要梯度或微调。基础版本无需训练数据、反向传播或 optimizer。第三得到规则的稠密模型。层数减少后可直接使用普通推理框架不依赖稀疏硬件。第四比直接删层更重视信息保留。被删除层的参数差异被合并进保留层而不是完全丢弃。第五适用于不同语言模型。论文在 LLaMA2、Baichuan2 以及附录中的 LLaMA2-70B 上进行了验证。二十一、方法局限1. 参数相加不等于函数复合连续 Transformer 层执行的是LaCo 却试图用一个参数合并后的单层近似这段非线性复合。通常并不存在因此 RDSC 缺少严格的函数近似理论。论文也承认目前没有完整理论证明。2. 参数空间未必天然对齐两个相邻层即使功能相似其 attention heads 或 FFN neurons 也可能采用不同的内部表示基底。直接逐元素相减和相加隐含假设是相同索引的参数具有相同语义。这个假设并不总成立。3. 最终表示相似可能掩盖能力损失LaCo 用少量普通句子检查最终隐藏状态平均余弦相似度。即使平均相似度很高也可能丢失数学推理长上下文代码罕见知识少数关键 token 的表示。因此十条 Wikipedia 句子无法覆盖模型的全部能力分布。4. 不能精确控制剪枝率LaCo 通过 (C、I、T、[L,H]) 等超参数间接控制结果需要反复调试才能得到目标层数。5. 基础语言建模能力下降明显虽然 LaCo 在任务平均分上优于结构化基线但 LLaMA2-7B 的 PPL 从 4.46 升至 13.93说明它并非近乎无损。6. 官方实现仍较初步官方仓库目前主要提供两个 Notebook尚不是适用于任意 Hugging Face 模型的一键式通用框架。(GitHub)二十二、整体评价LaCo 最有价值的地方是把 LLM 层剪枝从“删除层”推进到了“融合后再删除层”。它的基本判断是相邻层既有共同部分也有不同部分共同部分可以由一个保留层承担不同部分则通过参数差异累加保留下来。这个思路非常简单甚至有些大胆因为深层网络的函数复合通常无法通过参数线性叠加精确表达。但实验说明在相邻层高度相似、压缩率适中的情况下这种粗糙近似确实能够工作。从最近几篇 LLM 剪枝论文的脉络看SparseGPT剪单个权重用二阶重构补偿Wanda剪单个权重用权重和激活评分LLM-Pruner删除耦合结构组LoRAPrune用 LoRA 梯度指导结构剪枝Sheared LLaMA剪到目标架构后继续预训练Compresso用 LoRA、L0 mask 和提示学习结构ShortGPT直接删除表示变化小的层LaCo先融合连续层的参数差异再删除后续层。因此LaCo 最准确的定位是training-free, calibration-based, layer-level structured pruning through parameter fusion。二十三、一句话总结《LaCo: Large Language Model Pruning via Layer Collapse》提出一种参数融合式层剪枝方法对于若干连续 Transformer 层LaCo 以第一层为基准计算后续层相对它的参数差异并把这些差异累加回第一层然后删除后续层每次候选折叠后再用少量校准句子检查折叠模型和原模型最终隐藏状态的余弦相似度只有超过阈值才接受。LaCo 不需要梯度或微调在 LLaMA2-13B 上把 40 层压缩到 30 层、剪掉约 24.6% 参数后仍保留约 85.2% 的平均任务性能并获得真实显存和吞吐收益。它比 ShortGPT 的直接删层更重视被删层信息保留但参数线性合并缺乏严格理论困惑度仍明显上升且结果依赖校准数据和相似度阈值。

相关新闻

合肥专业的餐饮点餐小程序技术强的是哪家?

合肥专业的餐饮点餐小程序技术强的是哪家?

2026/7/23 22:31:03

在合肥餐饮行业数字化转型的浪潮中,选择一家专业且技术强大的餐饮点餐小程序服务商至关重要。众多企业纷纷角逐,而微客智联凭借其卓越表现,成为众多餐饮企业的首选。微客智联拥有全渠道点餐功能,真正实现全渠道订单归集。它聚合扫…

因算力紧缺,月之暗面Kimi宣布暂停C端新用户订阅;ASML回应向全球员工发2万欧元股权激励;Qwen3.8-Max预览版上线 | 极客头条

因算力紧缺,月之暗面Kimi宣布暂停C端新用户订阅;ASML回应向全球员工发2万欧元股权激励;Qwen3.8-Max预览版上线 | 极客头条

2026/7/23 22:31:03

算力告急?Kimi暂停新用户?!ASML发钱?!Qwen3.8-Max上天?!| 极客头条硬核拆解文章类型:技术教程 | 关键词:CSDN一、技术背景:当“算力饥荒”撞上“模型爆发”&a…

小程序自动部署埋点

小程序自动部署埋点

2026/7/23 22:31:03

阅读文档:https://www.npmjs.com/package/ctc-track-plugin 可以直接发给codex,部署埋点。 我在写完埋点时遇到的问题:

HuProt™ 人类蛋白组芯片用于天然产物靶点发现技术研究

HuProt™ 人类蛋白组芯片用于天然产物靶点发现技术研究

2026/7/23 23:31:06

天然产物因其复杂的化学组成和多样化的生物活性,在药物开发和生命科学研究领域持续受到关注。随着研究需求不断提升,仅了解天然产物是否具有功能作用已经难以满足科研要求,进一步明确其直接结合蛋白和作用机制成为研究重点。因此,…

电销团队每日拓客流程的系统化搭建方法:从名单获取到效果复盘

电销团队每日拓客流程的系统化搭建方法:从名单获取到效果复盘

2026/7/23 23:31:06

直接切痛点:针对电销团队效率低下问题,提出四环节标准化流程框架一个高效的每日拓客流程可以拆成四个标准化环节:名单获取、名单分配、集中拨打、每日复盘。每个环节有明确的操作标准和责任人,减少团队在"找名单""…

软件开发团队统一采购MacBook怎么选服务商

软件开发团队统一采购MacBook怎么选服务商

2026/7/23 23:31:06

软件开发团队统一配置MacBook,选择服务商的核心标准不在于价格最低,而在于服务商能否提供从Apple Business Manager(ABM)注册、DEP自动注册、MDM统一管控到全生命周期资产管理的全流程交付能力。神州数码作为Apple中国大陆授权分销…

【Springboot毕设全套源码+文档】基于springboot大学生勤工助学系统的设计与实现(丰富项目+远程调试+讲解+定制)

【Springboot毕设全套源码+文档】基于springboot大学生勤工助学系统的设计与实现(丰富项目+远程调试+讲解+定制)

2026/7/23 23:31:06

博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于Java、小程序技术领域和毕业项目实战 ✌️技术范围:&am…

Linux进阶篇04:GRUB2 深度配置与内核参数

Linux进阶篇04:GRUB2 深度配置与内核参数

2026/7/23 23:31:06

实验环境:VirtualBox 虚拟机,Rocky Linux 9,Legacy BIOS (非 UEFI)。 前置知识:已完成Rocky 9 启动流程学习,理解 GRUB2 是启动流程的第二阶段。 核心目标:掌握 /etc/default/grub 配置文件的修改逻辑&…

鸿蒙 ArkTS 实战:随身行李称重的限重解析、物品清单、启用状态与剩余重量

鸿蒙 ArkTS 实战:随身行李称重的限重解析、物品清单、启用状态与剩余重量

2026/7/23 23:21:05

鸿蒙 ArkTS 实战:随身行李称重的限重解析、物品清单、启用状态与剩余重量 前言 随身行李称重是一个基于 ArkTS 和 ArkUI 声明式 UI 的鸿蒙单页项目,入口文件位于 entry/src/main/ets/pages/Index.ets。 本文围绕 随身行李重量管理 场景,拆解…

微服务进阶:服务网格与Istio

微服务进阶:服务网格与Istio

2026/7/23 3:40:08

541|微服务进阶:服务网格与Istio 上篇文章我们聊了微服务的基本概念和拆分方法。 但微服务多了,问题也多了: 服务之间怎么通信? 怎么监控每个服务的调用链路? 熔断、限流、重试怎么做? 安全认证怎么统一? 以前这些都靠SDK库(比如Hystrix、Feign),每个服务都要集成…

零售超级终端全域协同:ShareKit 碰一碰商品流转业务落地案例

零售超级终端全域协同:ShareKit 碰一碰商品流转业务落地案例

2026/7/23 4:40:05

一、零售门店全域协同业务背景与行业痛点 1.1 门店超级终端设备矩阵(连锁便利店/商超标准配置) 自助收银Kiosk一体机:顾客结算、自助核销优惠券、商品素材预览;运营折叠平板:店长后台商品上新、图片录入、活动配置、…

噗叽短视频界面分析

噗叽短视频界面分析

2026/7/23 1:54:13

1 和小红书类似,可以采用类似判断方法------------其实他比小红书好判断,因为他没有图片,控件位置几乎是固定的,都不用判断------------2 因为他没有点赞按钮------------而且几乎所有控件位置都是完全一样的,所以我就…

企业级AI搜索落地选型实战手册(含LLM+RAG+Hybrid架构对比矩阵与ROI测算模板)

企业级AI搜索落地选型实战手册(含LLM+RAG+Hybrid架构对比矩阵与ROI测算模板)

2026/7/23 0:09:56

更多请点击: https://kaifayun.com 第一章:企业级AI搜索落地选型实战手册(含LLMRAGHybrid架构对比矩阵与ROI测算模板) 企业级AI搜索系统落地成败,核心在于技术选型与业务价值的精准对齐。盲目堆砌大模型能力或过度依赖…

TM4C129LNCZAD外设实战:LCD、比较器与PWM寄存器配置详解

TM4C129LNCZAD外设实战:LCD、比较器与PWM寄存器配置详解

2026/7/23 0:09:56

1. 项目概述与核心价值在嵌入式系统开发,尤其是基于ARM Cortex-M内核的微控制器项目中,深入理解并熟练配置芯片的片上外设,是从“点亮LED”迈向“实现复杂系统功能”的关键一步。Tiva™ TM4C129LNCZAD作为TI公司Cortex-M4F家族中的高性能成员…

AtomCode `fmt_dur` 争议溯源:两个函数、三段演进、四个事实

AtomCode `fmt_dur` 争议溯源:两个函数、三段演进、四个事实

2026/7/23 0:09:56

一、快速声明与争议背景本文是对 AtomCode 终端 spinner 时长显示 fmt_dur 相关说法的事实性核验。2026 年 7 月 CSDN 上出现两篇互相矛盾的博文,近期又有 AI 在对话中输出格式描述 XhYm / YmZs / Zs。本文基于 AtomCode 仓库 main4677ddfa 及全分支 Git 历史给出可…