Hadoop 3.3.5 单机版安装:从 JDK 1.8 到 MapReduce 单词统计的 10 步验证

发布时间:2026/9/28 21:31:40

Hadoop 3.3.5 单机版安装:从 JDK 1.8 到 MapReduce 单词统计的 10 步验证
Hadoop 3.3.5 单机版实战从环境搭建到单词统计全流程验证1. 环境准备与基础配置在开始Hadoop之旅前我们需要确保基础环境就绪。不同于简单的安装教程我们将从系统层面构建完整的Hadoop运行环境。以下是经过优化的配置方案系统要求Linux操作系统推荐Ubuntu 20.04 LTSJDK 1.8必须与Hadoop 3.3.5兼容至少4GB内存20GB可用磁盘空间关键配置步骤# 创建专用用户避免使用root权限 sudo useradd -m hadoop -s /bin/bash sudo passwd hadoop sudo adduser hadoop sudo环境变量配置~/.bashrc末尾添加export JAVA_HOME/usr/lib/jvm/jdk1.8.0_291 export HADOOP_HOME/usr/local/hadoop export PATH$PATH:$JAVA_HOME/bin:$HADOOP_HOME/bin:$HADOOP_HOME/sbin提示执行source ~/.bashrc使配置立即生效使用java -version和hadoop version验证安装2. Hadoop核心配置文件详解Hadoop 3.3.5的单机模式需要重点配置以下文件我们采用生产级参数优化core-site.xml位于$HADOOP_HOME/etc/hadoop/configuration property namefs.defaultFS/name valuehdfs://localhost:9000/value /property property namehadoop.tmp.dir/name value/usr/local/hadoop/tmp/value description确保此目录有写入权限/description /property property nameio.file.buffer.size/name value131072/value /property /configurationhdfs-site.xml关键配置对比参数单机模式值生产环境建议值dfs.replication13dfs.namenode.name.dirfile:/usr/local/hadoop/dfs/name多路径逗号分隔dfs.datanode.data.dirfile:/usr/local/hadoop/dfs/data多磁盘路径分隔3. HDFS初始化与服务启动首次启动必须执行的格式化命令hdfs namenode -format启动HDFS服务的完整流程检查SSH免密登录是否配置ssh localhost # 不应提示输入密码启动NameNode和DataNodestart-dfs.sh验证服务状态jps应看到以下进程NameNodeDataNodeSecondaryNameNodeWeb UI访问NameNode状态http://localhost:9870日志目录$HADOOP_HOME/logs/4. MapReduce单词统计实战现在进入核心验证环节——通过经典案例验证Hadoop处理能力。以下是完整操作流程步骤1准备测试数据mkdir ~/wordcount_test echo Hadoop MapReduce Hadoop HDFS MapReduce YARN HDFS HBase Hive Hadoop ~/wordcount_test/input.txt步骤2创建HDFS目录结构hdfs dfs -mkdir -p /user/hadoop/input hdfs dfs -put ~/wordcount_test/input.txt /user/hadoop/input步骤3执行MapReduce作业hadoop jar $HADOOP_HOME/share/hadoop/mapreduce/hadoop-mapreduce-examples-3.3.5.jar \ wordcount /user/hadoop/input /user/hadoop/output步骤4查看结果hdfs dfs -cat /user/hadoop/output/part-r-00000预期输出HBase 1 HDFS 2 Hadoop 3 Hive 1 MapReduce 2 YARN 15. 深度调试与问题排查当遇到作业失败时使用以下方法定位问题日志分析技巧# 查看最近的应用日志 yarn logs -applicationId 你的应用ID # 实时监控资源使用 hadoop dfsadmin -report常见错误解决方案错误现象可能原因解决方案Connection refused服务未启动检查start-dfs.sh执行情况Permission denied用户权限问题使用hdfs dfs -chmod修改权限ExitCode137内存不足调整mapreduce.map.memory.mb参数6. 性能优化建议即使是单机环境这些优化也能提升体验内存配置调整修改mapred-site.xmlproperty namemapreduce.map.memory.mb/name value1024/value /property property namemapreduce.reduce.memory.mb/name value1536/value /propertyJVM重用配置property namemapreduce.job.jvm.numtasks/name value10/value /property7. 扩展功能验证完成基础验证后可以进一步测试HDFS文件操作# 上传下载测试 hdfs dfs -put localfile /user/hadoop/ hdfs dfs -get /user/hadoop/localfile # 空间使用查询 hdfs dfs -du -h /YARN资源管理需额外配置start-yarn.sh8. 自动化脚本实现将整个验证流程脚本化保存为hadoop-test.sh#!/bin/bash # 初始化HDFS hdfs dfs -rm -r /user/hadoop/input /user/hadoop/output 2/dev/null hdfs dfs -mkdir -p /user/hadoop/input # 生成测试数据 cat EOF /tmp/sample.txt Apache Hadoop is an open-source software framework for distributed storage and processing of big data using the MapReduce programming model EOF # 上传数据 hdfs dfs -put /tmp/sample.txt /user/hadoop/input/ # 执行WordCount hadoop jar $HADOOP_HOME/share/hadoop/mapreduce/hadoop-mapreduce-examples-3.3.5.jar \ wordcount /user/hadoop/input /user/hadoop/output # 显示结果 echo -e \nWordCount Results: hdfs dfs -cat /user/hadoop/output/part-r-000009. 环境清理与重置完成验证后如需重新开始# 停止所有服务 stop-dfs.sh # 清理数据目录 rm -rf /usr/local/hadoop/tmp/ # 重新格式化 hdfs namenode -format10. 生产环境迁移建议当从单机转向集群时需要特别注意配置文件差异将localhost替换为实际主机名调整dfs.replication值为3配置slaves文件指定DataNode硬件规划原则NameNode与DataNode分离部署每个DataNode配置多块磁盘预留足够内存给系统进程监控方案启用Hadoop JMX接口配置Ganglia或Prometheus监控设置日志聚合功能

相关新闻

C++实现整数平方根:二分查找与牛顿迭代算法详解

C++实现整数平方根:二分查找与牛顿迭代算法详解

2026/9/25 21:51:00

1. 项目概述:从一道经典面试题说起 最近在带新人刷题,发现很多人卡在LeetCode 69这道“x的平方根”上。题目本身不难,但很多人要么暴力求解超时,要么对二分查找的边界处理得稀里糊涂,要么就是写出来的C代码又臭又长。这…

4K视频播放全攻略:硬件配置、软件优化与AI增强技术解析

4K视频播放全攻略:硬件配置、软件优化与AI增强技术解析

2026/9/28 21:30:52

这次我们来看一部4K修复版的经典励志电影《追梦赤子心》。这部电影改编自真实故事,讲述身高仅1米68的鲁迪鲁埃蒂格如何在嘲讽和质疑中坚持十年,最终实现圣母大学橄榄球队梦想的感人经历。虽然只有27秒上场时间,但这段经历成为了体育史上最动人…

别再尝试跨平台登录了!从底层服务器架构与数据库模型,硬核拆解 MT4 与 MT5 账户无法互通的根本原因

别再尝试跨平台登录了!从底层服务器架构与数据库模型,硬核拆解 MT4 与 MT5 账户无法互通的根本原因

2026/8/27 1:55:25

引言:在金融量化交易与自动化交易(EA)领域,MetaTrader 4(MT4)和 MetaTrader 5(MT5)是迈达克(MetaQuotes)公司的两大划时代巨作。许多刚刚从传统 IT 领域跨界进…

CANN/GE ACL数据集缓冲区添加函数

CANN/GE ACL数据集缓冲区添加函数

2026/9/28 4:08:17

aclmdlAddDatasetBuffer 【免费下载链接】ge GE(Graph Engine)是面向昇腾的图编译器和执行器,提供了计算图优化、多流并行、内存复用和模型下沉等技术手段,加速模型执行效率,减少模型内存占用。 GE 提供对 PyTorch、Te…

用ffmpeg高效批量调整图片尺寸的实战指南

用ffmpeg高效批量调整图片尺寸的实战指南

2026/9/28 16:01:49

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

Transformers 音频特征提取工具库 audio_utils 全解析:从 Mel 刻度换算到对数 Mel 频谱

Transformers 音频特征提取工具库 audio_utils 全解析:从 Mel 刻度换算到对数 Mel 频谱

2026/9/28 2:15:29

Transformers 音频特征提取工具库 audio_utils 全解析:从 Mel 刻度换算到对数 Mel 频谱 【免费下载链接】transformers 🤗 Transformers: the model-definition framework for state-of-the-art machine learning models in text, vision, audio, and mu…

RustFS 多节点集群重启与滚动升级实战:Readiness、Quorum 与 Degraded 模式完全指南

RustFS 多节点集群重启与滚动升级实战:Readiness、Quorum 与 Degraded 模式完全指南

2026/9/28 3:14:54

RustFS 多节点集群重启与滚动升级实战:Readiness、Quorum 与 Degraded 模式完全指南 【免费下载链接】rustfs 🚀2.3x faster than MinIO for 4KB object payloads. RustFS is an open-source, S3-compatible high-performance object storage system sup…

Java Integer缓存揭秘:128陷阱原理、避坑与面试全解

Java Integer缓存揭秘:128陷阱原理、避坑与面试全解

2026/9/28 3:58:00

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

RustFS Scanner 数据用量发布权威性决策:配额准入如何获得可用的权威依据

RustFS Scanner 数据用量发布权威性决策:配额准入如何获得可用的权威依据

2026/9/28 3:47:14

RustFS Scanner 数据用量发布权威性决策:配额准入如何获得可用的权威依据 【免费下载链接】rustfs 🚀2.3x faster than MinIO for 4KB object payloads. RustFS is an open-source, S3-compatible high-performance object storage system supporting mi…

远程协作的工作台整理

远程协作的工作台整理

2026/9/28 16:01:48

远程协作的工作台整理远程协作的核心不是再加一个工具,而是让交接信息足够完整。异步任务要写明目标、输入位置、完成标准和需要决策的人。 工作台的最小配置 将日程、待办、代码和沟通入口收拢到少数固定位置;通知按紧急程度分层。工作台不需要模仿办公…

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

2026/9/28 5:05:21

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

2026/9/28 16:01:48

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…