【数据结构】哈夫曼编码如何节省内存

发布时间:2026/7/22 2:08:13

【数据结构】哈夫曼编码如何节省内存
哈夫曼编码通过为高频字符分配短码、低频字符分配长码的变长编码策略并确保编码为前缀码以避免歧义从而显著减少表示相同信息所需的总比特数达到节省内存的目的。以下通过一个具体例子对比常规的等长编码与哈夫曼编码清晰展示其节省内存的原理。示例编码字符串 “ABRACADABRA”假设我们需编码的字符集为{A, B, C, D, R}。首先统计各字符在字符串中的出现频率概率字符出现次数频率约A55/11 ≈ 0.455B22/11 ≈ 0.182R22/11 ≈ 0.182C11/11 ≈ 0.091D11/11 ≈ 0.0911. 常规等长编码如ASCII或固定位宽编码对于5个不同字符至少需要3位二进制数2³8 5才能唯一表示每个字符。一种可能的等长编码方案如下字符等长编码3位A000B001C010D011R100编码字符串 “ABRACADABRA”A B R A C A D A B R A 000 001 100 000 010 000 011 000 001 100 000总编码长度 11个字符 × 3位/字符 33位。2. 哈夫曼编码变长前缀编码根据字符频率构建哈夫曼树构建过程遵循贪心算法每次合并频率最小的两个节点并为从根到叶子的路径分配编码通常左0右1得到如下哈夫曼编码表字符哈夫曼编码编码长度A频率最高01位B1103位R1113位C1003位D1013位注意此编码是前缀码任何字符的编码都不是另一个字符编码的前缀确保了解码的唯一性。使用哈夫曼编码对同一字符串进行编码A B R A C A D A B R A 0 110 111 0 100 0 101 0 110 111 0计算总编码长度A出现5次5 × 1位 5位B出现2次2 × 3位 6位R出现2次2 × 3位 6位C出现1次1 × 3位 3位D出现1次1 × 3位 3位总长度 5 6 6 3 3 23位。3. 节省内存对比分析编码方案总编码长度位节省的位数节省比例等长编码3位33-哈夫曼编码变长2310约30.3%节省原因的核心解析变长编码匹配字符频率哈夫曼编码的核心思想是让出现频率高的字符使用尽可能短的编码。本例中最高频的字符A仅用1位编码0而等长编码固定使用3位。对于高频字符位数的减少产生了巨大的节约效应。最小化加权路径长度WPL哈夫曼树是带权路径长度最短的二叉树。字符的编码长度即为其在树中的路径长度字符频率即为其权重。哈夫曼编码的总长度Σ(频率 × 编码长度)就是树的WPL哈夫曼算法保证了该值最小。在本例中WPL被优化至23远低于等长编码的固定成本33。前缀码保证无损解码尽管编码长度不一但前缀码的特性确保了编码序列可以被唯一、无歧义地解码无需额外的分隔符进一步提升了存储效率。代码示例哈夫曼树节点结构与编码计算Python示意import heapq from collections import defaultdict, Counter class HuffmanNode: def __init__(self, char, freq): self.char char self.freq freq self.left None self.right None # 用于堆比较 def __lt__(self, other): return self.freq other.freq def build_huffman_tree(text): # 1. 统计频率 frequency Counter(text) # 2. 构建最小堆优先队列 heap [HuffmanNode(char, freq) for char, freq in frequency.items()] heapq.heapify(heap) # 3. 贪心合并每次弹出两个频率最小的节点合并为新节点 while len(heap) 1: left heapq.heappop(heap) right heapq.heappop(heap) merged HuffmanNode(None, left.freq right.freq) merged.left left merged.right right heapq.heappush(heap, merged) return heap[0] # 返回根节点 def generate_codes(node, current_code, code_map{}): if node is None: return # 叶子节点存储字符到编码的映射 if node.char is not None: code_map[node.char] current_code generate_codes(node.left, current_code 0, code_map) generate_codes(node.right, current_code 1, code_map) return code_map # 示例运行 text ABRACADABRA root build_huffman_tree(text) huffman_codes generate_codes(root) print(哈夫曼编码表:, huffman_codes) # 输出可能类似{A: 0, C: 100, D: 101, B: 110, R: 111} encoded_text .join(huffman_codes[ch] for ch in text) print(编码结果:, encoded_text) print(原等长编码长度:, len(text) * 3) # 假设3位等长 print(哈夫曼编码长度:, len(encoded_text))以上代码演示了哈夫曼树构建与编码生成的关键步骤实际应用还需包含写入文件头编码表等完整压缩流程。结论哈夫曼编码通过统计字符频率、构建最优前缀码使高频字符占用极短码字从而在整体上大幅降低了数据的比特表示长度。相较于无视频率差异的等长编码它在处理字符分布不均匀的数据时这是现实数据的普遍特征能实现显著的内存节省。参考来源哈夫曼编码哈夫曼编码哈夫曼编码字符串压缩哈夫曼编码与解码算法 {哈夫曼编码, 哈夫曼树}

相关新闻

开源给开发者的意义:ZGI 希望和社区一起补齐 AI 应用工程化

开源给开发者的意义:ZGI 希望和社区一起补齐 AI 应用工程化

2026/7/22 2:08:13

开源不是把代码放出来就结束了。真正有价值的开源,是让开发者能够看见项目怎么设计,能够在自己的环境里跑起来,能够指出问题,也能够按自己的场景改造它。ZGI 这次在 Gitee 同步开源,也是希望和国内开发者建立更直接的连…

从零到一:用Duix-Avatar在本地构建你的专属AI数字人

从零到一:用Duix-Avatar在本地构建你的专属AI数字人

2026/7/22 2:08:13

从零到一:用Duix-Avatar在本地构建你的专属AI数字人 【免费下载链接】Duix-Avatar 🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning. 项目地址: https://gitcode.com/GitHub_Trending…

Obsidian-skills终极指南:让AI助手掌握Obsidian的完整教程

Obsidian-skills终极指南:让AI助手掌握Obsidian的完整教程

2026/7/22 1:58:13

Obsidian-skills终极指南:让AI助手掌握Obsidian的完整教程 【免费下载链接】obsidian-skills Agent skills for Obsidian. Teach your agent to use Obsidian CLI and open formats including Markdown, Bases, JSON Canvas. 项目地址: https://gitcode.com/GitHu…

AI在金融市场的核心应用与关键技术解析

AI在金融市场的核心应用与关键技术解析

2026/7/22 4:38:20

1. AI在金融市场的核心应用场景解析金融市场作为数据密集型和高度依赖决策的领域,正成为AI技术落地的前沿阵地。过去三年间,全球头部金融机构在AI领域的投入年均增长率达到37%,这个数字背后反映的是AI对传统金融业务模式的根本性变革。1.1 高…

医疗大模型核心技术解析与落地实践

医疗大模型核心技术解析与落地实践

2026/7/22 4:38:20

1. 智慧医疗与大模型结合的行业背景医疗行业正经历着数字化转型的浪潮,而人工智能技术的引入正在重塑传统的诊疗模式。根据世界卫生组织的数据,全球每年因误诊导致的医疗事故约占全部医疗差错的10-15%。在这样的背景下,大模型技术为提升诊断准…

健康管理实践:个性化评估与科技赋能

健康管理实践:个性化评估与科技赋能

2026/7/22 4:38:20

1. 黄锦辉:一位深耕健康领域的实践者 2026年健康之星黄锦辉的故事,是一个关于专注、坚持与创新的典型案例。作为健康产业的中坚力量,黄锦辉用十年如一日的深耕实践,诠释了什么是真正的"匠心筑梦"。 在健康管理这个需要…

从“数据容器“的角度,彻底掌握 Python 五大核心数据结构

从“数据容器“的角度,彻底掌握 Python 五大核心数据结构

2026/7/22 4:38:20

一、数据结构全景图1.1 一句话认识五大结构# 如果把数据比作"物品",数据结构就是不同的"收纳方式"str "hello" # 字符的排列(像一串珠子) list [1, 2, 3] # 有序的箱子(可以随意增…

动漫创作赛事指南:从题材选择到商业价值

动漫创作赛事指南:从题材选择到商业价值

2026/7/22 4:38:20

1. 赛事背景与核心价值"燃烧吧,动漫の魂!"这个标题本身就充满了热血与激情。作为从业十余年的动漫内容创作者,我深知这类征文活动对行业的特殊意义。不同于常规文学比赛,动漫题材创作要求作者同时具备故事架构能力、视觉想象力以及…

RAG 索引为什么会召回已删内容:增量更新与删除传播

RAG 索引为什么会召回已删内容:增量更新与删除传播

2026/7/22 4:28:20

RAG 的向量索引,本质上是源数据的一份缓存。源文档更新或删除后,如果索引没有同步,检索仍会返回旧内容,而且通常不会报错。用户看到的是一条看似正常的答案,系统却可能引用了已经失效的事实。 一、最容易漏掉的是删除…

微服务进阶:服务网格与Istio

微服务进阶:服务网格与Istio

2026/7/21 5:45:57

541|微服务进阶:服务网格与Istio 上篇文章我们聊了微服务的基本概念和拆分方法。 但微服务多了,问题也多了: 服务之间怎么通信? 怎么监控每个服务的调用链路? 熔断、限流、重试怎么做? 安全认证怎么统一? 以前这些都靠SDK库(比如Hystrix、Feign),每个服务都要集成…

零售超级终端全域协同:ShareKit 碰一碰商品流转业务落地案例

零售超级终端全域协同:ShareKit 碰一碰商品流转业务落地案例

2026/7/21 9:56:14

一、零售门店全域协同业务背景与行业痛点 1.1 门店超级终端设备矩阵(连锁便利店/商超标准配置) 自助收银Kiosk一体机:顾客结算、自助核销优惠券、商品素材预览;运营折叠平板:店长后台商品上新、图片录入、活动配置、…

噗叽短视频界面分析

噗叽短视频界面分析

2026/7/21 3:09:32

1 和小红书类似,可以采用类似判断方法------------其实他比小红书好判断,因为他没有图片,控件位置几乎是固定的,都不用判断------------2 因为他没有点赞按钮------------而且几乎所有控件位置都是完全一样的,所以我就…

设计EDA 首席专家 12 维度 JD(HR 仅高管 / HRD 使用)

设计EDA 首席专家 12 维度 JD(HR 仅高管 / HRD 使用)

2026/7/22 0:08:09

定位:公司 EDA 技术最高负责人、技术天花板、战略级专家、流片总兜底人 属于P9/Fellow/ 首席科学家级,不做日常执行,管方向、管架构、管风险、管突破。1. 对标层级内部职级:P9 / 首席专家 / Fellow 外部对标:华为 20–…

费用率无法实时监控怎么办?费用率联动预算管理怎么实现?

费用率无法实时监控怎么办?费用率联动预算管理怎么实现?

2026/7/22 0:08:09

很多企业费用管控存在严重滞后性:日常差旅、招待、营销、人力费用持续发生,但费用率只能等到月末结账、营收数据出来后才能计算核对,月度中途费用超标、营收不达标导致的费用率失衡完全无法感知。等到月末发现整体费用率远超预算目标时&#…

设计EDA 研发总监 12 维度 JD(HR 内部仅高管层使用)

设计EDA 研发总监 12 维度 JD(HR 内部仅高管层使用)

2026/7/22 0:08:09

定位:公司 EDA / 设计平台最高管理岗,技术 管理 经营三重决策,对整体流片、效率、质量、成本、团队负最终责任1. 对标层级内部职级:M3 / P8 / 总监级 外部对标:华为 20 级、互联网 M2 / 总监、头部芯片 / EDA 公司研…