Hadoop大数据平台部署与应用(AI助学)
书号:9787113334536 套系名称:应用型人才培养系列教材
作者:黑马程序员 出版日期:2026-08-01
定价:59.80 页码 / 开本:无 /16
策划编辑:翟玉峰 责任编辑:翟玉峰 王占清
适用专业:计算机类 适用层次:高职教育
最新印刷时间:2026-08-01
-
本书坚持“夯实基础、任务引领、实践导向”的原则,采用“任务驱动”编写模式,系统介绍Hadoop 大数据生态系统的核心组件,将关键知识点融入具体开发任务,引导读者在任务实施过程中逐步掌握各组件的使用。全书共分 7 个单元,内容覆盖大数据概念、Hadoop 理论基础与部署,以及HDFS、MapReduce、Hive、HBase、Spark 等核心组件的应用,并配套综合项目实战。全书系统呈现基于 Hadoop 生态构建大数据平台、完成端到端数据处理与分析的完整流程。 本书附有丰富的教学资源,包括配套教学PPT、教学大纲、教学设计、源代码、课后习题及答案等,并特别为读者提供了在线答疑服务。 本书兼具系统性、实用性与时代性,适合作为应用型高等学校数据科学与大数据技术等计算机类专业教材,也可作为高等职业院校大数据技术等计算机类专业的教材,还可作为数据开发、数据分析岗位培训的实践指导用书。 -
本书在编写的过程中,结合党的二十大精神进教材、进课堂、进头脑的要求,将素质教育内容融入日常学习中,让学生在学习新兴技术的同时提升爱国热情,增强民族自豪感和自信心,引导学生树立正确的世界观、人生观和价值观,进一步提升学生的职业素养,落实德才兼备、高素质技术技能人才培养要求。 为落实“产教融合”,本书编写团队由高校教师和黑马程序员共同组成。高校教师具有扎实的理论基础和教学经验,能够将理论知识与教学方法有机结合;黑马程序员具有丰富的企业项目经验,能够提供行业最新技术和实际项目案例。在编写本书的过程中,编写团队定期开展交流活动,如黑马程序员会提供项目实战的相关资料,让高校教师深入了解企业的开发流程和技术应用场景。 在大数据技术快速发展的背景下,企业对数据处理与分析的要求持续提升,关注点不仅在于存储规模的扩展,更体现在计算性能、查询效率及数据价值挖掘能力等方面。传统关系型数据库在面对海量数据与复杂分析任务时逐步暴露出扩展性与成本方面的限制,难以有效支撑高吞吐量的数据处理、PB级数据存储及大规模批处理分析等典型场景。Hadoop作为开源的大数据处理框架,依托分布式存储与分布式计算体系,能够以较低成本构建可横向扩展的数据处理平台,为海量数据的存储与分析提供可行的技术路径。 全书坚持“夯实基础、任务引领、实践导向”的原则,采用“任务驱动”编写模式对Hadoop生态体系进行教学化组织,按照“平台搭建—组件应用—综合实践”的逻辑,依次介绍Hadoop环境部署与配置、HDFS分布式文件管理、MapReduce离线数据分析、Hive数据仓库应用、HBase数据库应用、Spark 内存计算与实时处理等内容,并配 套“电商平台大数据分析系统”综合实战,帮助学生逐步建立大数据平台搭建、数据存储、离线计算、数据仓库应用和综合项目实践等基本能力。本书还设置了AI助学内容,引导学生借助生成式人工智能辅助理解知识、分析问题和完成实践任务,培养其合理、规范使用人工智能工具的能力。本书适合作为应用型高等学校数据科学与大数据技术等计算机类专业教材,也可作为高等职业院校大数据技术等计算机类专业的教材,还可作为数据开发、数据分析岗位培训的实践指导用书。 本书的参考学时为52学时,各单元的参考学时如下表所示。 各单元的参考学时 单 元 学 时 单元 1 Hadoop 环境部署与配置 8 单元 2 HDFS 分布式文件管理 6 单元 3 MapReduce 离线数据分析 6 单元 4 Hive 数据仓库应用 8 单元 5 HBase 数据库应用 6 单元 6 Spark 内存计算与实时处理 8 单元 7 综合实战——电商平台大数据分析系统 10 总 计 52 本书符合新形态一体化要求,配备了丰富的数字化教学资源,如教学PPT、教学大纲、教学设计、源代码、课后习题及答案等,并配套高校教辅平台。高校教辅平台向教师提供整套数字化教学服务,如在线教学和在线考试等。同时,本书配套了高校学习平台,为学生提供多元化的学习渠道,学生可以在高校学习平台上随时随地自主学习。此外,编写团队还提供在线答疑服务,及时解答学生在学习过程中遇到的疑问,实现教学互动无缝对接。请扫描左边二维码获取本书配套资源和服务。 本书由黑马程序员组编,孟繁兴、李晓霞、曹代任主编,王立英、王军任副主编。尽管编者尽了最大的努力,但书中难免会有不妥之处,欢迎读者来信给予宝贵意见,编者将不胜感激。电子邮箱地址:itcast_book@vip.sina.com。 编 者 2026年1月 -
单元1 Hadoop环境部署与配置 1 学习目标 1 任务1 搭建大数据基础运行环境 2 任务需求 2 知识讲解 2 1. 大数据简介 2 2. 大数据的数据类型 2 任务实现 3 1. 创建虚拟机 4 2. 安装Linux操作系统 12 3. 克隆虚拟机 19 4. 配置网络参数 21 5. 配置主机名和IP映射 25 6. 配置SSH远程登录 26 7. 配置SSH免密登录 31 8. 配置防火墙 32 9. 创建目录 33 10. 安装JDK 33 任务2 基于完全分布式模式部署Hadoop 36 任务需求 36 知识讲解 36 1. Hadoop概述 36 2. Hadoop核心组件 37 3. Hadoop完全分布式架构 38 任务实现 40 1. 集群规划 40 2. 上传Hadoop安装包 40 3. 安装Hadoop 40 4. 修改配置文件hadoop-env.sh 40 5. 修改配置文件core-site.xml 41 6. 修改配置文件hdfs-site.xml 42 7. 修改配置文件mapred-site.xml 43 8. 修改配置文件yarn-site.xml 43 9. 修改配置文件workers 44 10. 分发Hadoop安装目录 44 11. 配置Hadoop系统环境变量 45 12. 初始化系统环境变量 45 13. 格式化HDFS 45 14. 启动HDFS 45 15. 启动YARN 46 16. 启动作业历史服务 46 任务3 基于高可用模式部署Hadoop 47 任务需求 47 知识讲解 47 1. ZooKeeper概述 47 2. Hadoop高可用架构 48 任务实现 49 1. 部署ZooKeeper 49 2. 部署Hadoop 53 AI助学 62 单元总结 63 习题 63 单元2 HDFS分布式文件管理 65 学习目标 65 任务1 构建资源管理平台 66 任务需求 66 知识讲解 66 使用HDFS Web UI操作HDFS 66 任务实现 69 1. 构建目录结构 69 2. 上传公共资源 70 3. 移动文件 71 4. 查看文件 72 5. 下载文件 74 6. 删除文件 74 任务2 构建日志管理平台 75 任务需求 75 知识讲解 75 使用HDFS Shell操作HDFS 75 任务实现 78 1. 构建目录结构 78 2. 上传日志文件 79 3. 查看目录结构 79 4. 移动日志文件 79 5. 查看日志文件的内容 80 6. 统计归档日志占用空间 81 7. 下载日志文件 81 8. 删除日志文件 82 任务3 构建数据管理平台 82 任务需求 82 知识讲解 83 使用HDFS Java API操作HDFS 83 任务实现 85 1. 环境准备 85 2. 连接HDFS 86 3. 构建目录结构 87 4. 上传数据文件 88 5. 查看目录结构 89 6. 移动数据文件 90 7. 下载数据文件 91 8. 删除数据文件 92 AI助学 93 单元总结 93 习题 93 单元3 MapReduce离线数据分析 95 学习目标 95 任务1 热门搜索关键词分析 96 任务需求 96 知识讲解 96 1. MapReduce编程模型 96 2. MapReduce核心组件 97 任务实现 102 1. 环境准备 102 2. 实现Mapper 102 3. 实现Reducer 103 4. 实现Driver 104 5. 打包JAR文件 105 6. 运行MapReduce程序 105 7. 查看结果文件 106 任务2 各区域商品销售分析 107 任务需求 107 知识讲解 108 Partitioner 108 任务实现 108 1. 环境准备 109 2. 实现Mapper 109 3. 实现Partitioner 109 4. 实现Reducer 110 5. 实现Driver 111 6. 运行MapReduce程序 112 7. 查看结果文件 112 任务3 热销商品分析 113 任务需求 113 知识讲解 114 Combiner 114 任务实现 114 1. 环境准备 114 2. 实现Mapper 115 3. 实现Combiner 115 4. 实现Reducer 116 5. 实现Driver 118 6. 运行MapReduce程序 118 7. 查看结果文件 118 AI助学 119 单元总结 119 习题 119 单元4 Hive数据仓库应用 121 学习目标 121 任务1 基于远程模式部署Hive 122 任务需求 122 知识讲解 122 1. Hive简介 122 2. Hive系统架构 123 3. Beeline的基本使用 124 4. Hive部署模式 127 任务实现 128 1. 安装MySQL 128 2. 启动Hadoop 129 3. 安装Tez 129 4. 在虚拟机Node03部署Hive 130 5. 在虚拟机Node02部署Hive 132 6. 操作Hive 134 任务2 搭建电商业务数据仓库 134 任务需求 134 知识讲解 135 1. 数据仓库简介 135 2. 数据仓库分层架构 135 3. Hive数据模型 136 4. Hive数据类型 138 5. 数据库的常见操作 140 6. 表的常见操作 142 任务实现 147 1. 创建数据库 147 2. 构建ODS层 147 3. 构建DW层 149 4. 构建DA层 150 5. 查询表 150 任务3 电商业务数据装载 151 任务需求 151 知识讲解 151 1. 向表中加载数据 151 2. 向表中插入数据 152 任务实现 153 1. 向表ods_user中加载数据 153 2. 向表ods_product中加载数据 154 3. 向表ods_order中加载数据 154 4. 向表dwd_user_detail中插入数据 155 5. 向表dwd_product_detail中插入数据 156 6. 向表dwd_order_detail中插入数据 157 任务4 用户消费行为分析 158 任务需求 158 知识讲解 158 1. 数据查询操作 158 2. 聚合函数 159 3. 连接查询 159 任务实现 163 1. 向表dwb_user_order中插入数据 163 2. 分析各省级行政区用户的消费情况 164 3. 分析各用户消费情况 165 AI助学 166 单元总结 166 习题 167 单元5 HBase数据库应用 169 学习目标 169 任务1 基于完全分布式模式部署HBase 170 任务需求 170 知识讲解 170 1. HBase简介 170 2. HBase体系结构 171 3. HBase部署模式 173 任务实现 173 1. 上传HBase安装包 173 2. 安装HBase 173 3. 修改配置文件hbase-env.sh 173 4. 修改配置文件hbase-site.xml 174 5. 修改配置文件regionservers 174 6. 修改配置文件log4j.properties 174 7. 分发HBase安装目录 175 8. 配置HBase系统环境变量 175 9. 初始化系统环境变量 175 10. 启动Hadoop 175 11. 启动ZooKeeper 175 12. 启动HBase 175 任务2 构建电商业务存储体系 176 任务需求 176 知识讲解 176 1. HBase Shell 176 2. 命名空间的常见操作 177 任务实现 177 1. 运行HBase Shell 177 2. 创建命名空间 178 3. 查询命名空间 178 任务3 电商核心业务表管理 179 任务需求 179 知识讲解 179 1. HBase数据模型 179 2. 表的常见操作 180 任务实现 183 1. 创建表user_info 183 2. 创建表product_info 183 3. 创建表order_detail 183 4. 查询表 183 5. 查看表user_info的信息 183 6. 停用表product_info 185 7. 启用表product_info 185 8. 在表user_info中新增列族 186 9. 修改表user_info中列族的属性 186 10. 删除表user_info中的列族 187 任务4 电商业务数据基础操作 188 任务需求 188 知识讲解 188 数据的常见操作 188 任务实现 189 1. 向表user_info插入数据 189 2. 向表product_info插入数据 190 3. 向表order_detail插入数据 190 4. 查询用户信息 191 5. 查询用户的基本信息 192 6. 查询商品信息 192 7. 查询订单信息 192 8. 追加数据 193 任务5 电商业务数据条件查询 194 任务需求 194 知识讲解 194 条件查询的常见操作 194 任务实现 195 AI助学 197 单元总结 197 习题 197 单元6 Spark内存计算与实时处理 199 学习目标 199 任务1 基于Standalone模式部署Spark 200 任务需求 200 知识讲解 200 1. Spark简介 200 2. Standalone基本架构 201 3. spark-submit的使用 203 任务实现 204 1. 上传Spark安装包 204 2. 创建目录 205 3. 安装Spark 205 4. 重命名Spark安装目录 205 5. 创建配置文件spark-env.sh 205 6. 修改配置文件spark-env.sh 205 7. 创建配置文件spark-defaults.conf 206 8. 修改配置文件spark-defaults.conf 206 9. 创建配置文件workers 206 10. 修改配置文件workers 206 11. 创建Spark应用程序写入日志的目录 207 12. 分发Spark安装目录 207 13. 配置Spark系统环境变量 207 14. 初始化系统环境变量 207 15. 启动Spark 207 16. 启动历史服务器 208 17. 测试Spark集群 208 任务2 基于Spark on YARN模式部署Spark 209 任务需求 209 知识讲解 209 Spark on YARN运行原理 209 任务实现 210 1. 关闭Standalone模式部署的Spark 210 2. 上传Spark安装包 210 3. 安装Spark 210 4. 重命名目录 210 5. 创建配置文件spark-env.sh 210 6. 编辑配置文件spark-env.sh 210 7. 创建配置文件spark-defaults.conf 211 8. 编辑配置文件spark-defaults.conf 211 9. 配置Spark系统环境变量 211 10. 初始化系统环境变量 211 11. 创建日志存储目录 212 12. 启动历史服务 212 13. 测试Spark 212 任务3 用户行为日志预处理 213 任务需求 213 知识讲解 214 1. DataFrame简介 214 2. DataFrame的创建 214 3. DataFrame的常用操作 217 4. DataFrame的输出 219 任务实现 221 1. 环境准备 221 2. 实现Spark应用程序 221 3. 封装项目SparkJob 223 4. 上传JAR文件 224 5. 创建目录 224 6. 上传文件 224 7. 启动Metastore 224 8. 启动HiveServer2 224 9. 创建表 224 10. 运行Spark应用程序 225 11. 查看结果 225 任务4 日均商品销售额分析 226 任务需求 226 知识讲解 226 DataFrame的函数操作 226 任务实现 228 1. 实现Spark应用程序 228 2. 运行Spark应用程序 230 任务5 商品交易实时分析 230 任务需求 230 知识讲解 231 1. Structured Streaming编程模型 231 2. Structured Streaming的输入操作 232 3. Structured Streaming的输出操作 234 任务实现 235 1. 部署Kafka 235 2. 创建Topic 237 3. 添加依赖 237 4. 模拟生成订单支付数据 238 5. 实现Spark应用程序 239 6. 新建用户 241 7. 创建表 241 8. 运行Spark应用程序 241 9. 查看结果 241 任务6 热门商品实时分析 242 任务需求 242 知识讲解 242 Structured Streaming的窗口操作 242 任务实现 244 1. 实现Spark应用程序 244 2. 启动Kafka服务 246 3. 运行Spark应用程序 246 AI助学 247 单元总结 247 习题 247 单元7 综合实战——电商平台大数据分析系统 .249 学习目标 249 任务1 业务数据存储设计与实现 250 任务介绍 250 任务操作 252 任务2 用户行为数据预处理 253 任务介绍 253 任务操作 253 任务3 构建电商业务数据仓库 258 任务介绍 258 任务操作 261 任务4 构建用户画像存储系统 269 任务介绍 269 任务操作 269 任务5 离线业务指标统计 281 任务介绍 281 任务操作 281 任务6 实时业务指标统计 287 任务介绍 287 任务操作 288 AI助学 294 单元总结 294
-
江苏传智播客教育科技股份有限公司(简称传智教育)是一家培养高精尖数字化专业人才的公司,主要培养人工智能、大数据、智能制造、软件开发、区块链、数据分析、网络营销、新媒体等领域的人才。北京传智播客教育科技有限公司是由江苏传智播客教育科技股份有限公司100%持股公司。
-
(1)全书坚持“夯实基础、任务引领、实践导向”的原则,采用“任务驱动”编写模式对Hadoop生态体系进行教学化组织,按照“平台搭建—组件应用—综合实践”的逻辑,帮助学生逐步建立大数据平台搭建、数据存储、离线计算、数据仓库应用和综合项目实践等基本能力。 (2)本书设置了AI助学内容,引导学生借助生成式人工智能辅助理解知识、分析问题和完成实践任务,培养其合理、规范使用人工智能工具的能力。 (3) 本书附有丰富的教学资源,包括配套教学PPT、教学大纲、教学设计、源代码、课后习题及答案等,并特别为读者提供了在线答疑服务。
