一、课程信息
表1 课程信息表
|
课程名称(学时) |
Hadoop平台搭建与应用 (32学时) |
开课院部 |
人工智能学院 |
|
课程代码 |
ZN0073Z |
适用专业及专业代码 |
大数据技术 (510205) |
|
课程属性 |
□公共基础平台课程□专业(群)平台基础课程√专业(群)专业课程 |
||
|
课程性质 |
√必修课□限选课□任选课 |
||
|
考核方式 |
③技能测试④面试 |
||
|
前导课程 |
《大数据技术原理与应用》 |
||
|
后续课程 |
《ECharts》、《Tableau》 |
||
考核方式:①闭卷,②开卷,③技能测试,④面试(含答辩、口试、表演等),⑤小论文,⑥报告(含读书报告、调查报告、实习报告等),⑦项目(方案)设计,⑧课程实践,⑨其它。
二、课程性质与任务
(一)课程性质
《Hadoop平台搭建与应用》本课程是软件技术专业核心课程,大数据技术入门课程。通过学习课程使得学生掌握大数据分析的主要思想和基本步骤,并通过编程练习和典型应用实例加深了解;同时对Hadoop平台应用与开发的一般理论有所了解,如分布式数据收集、分布式数据存储、分布式数据计算、分布式数据展示。
开设本学科的目的是让学生掌握如何使用大数据分析技术解决特定业务领域的问题。本课程学习后能够熟练的应用大数据技术解决企业中的实际生产问题。
(二)教学任务
本课程以“高职院校学情分析”系统为项目原型,以任务驱动为主线,基于Hadoop大数据平台,讲解大数据平台的搭建与运维、大数据的采集与存储、大数据的处理、数据的分析、数据的可视化等完整的大数据应用案例,全面详细地讲述Hadoop、MapReduce、HDFS、Hive和Sqoop等技术的相关知识,并详细讨论了Mahout大数据分析中的常用算法K-means聚类算法、Canopy聚类算法、欧氏距离算法、余弦距离算法、皮尔逊相关系数算法、TF-IDF加权算法等的使用及相关学情分析系统中算法的实现等。
三、课程目标与要求
(一)总体目标与要求
本课程遵循高等职业教育规律,以大数据技术与应用实际工作岗位需求为导向选取课程内容,课程目标是培养学生具备“大数据分析”应用项目所需系统环境的:搭建与测试综合职业能力;坚持开放性设计原则,吸收企业专家参与,建立基于Hadoop的生态环境,以“工作任务”为载体的“项目化”课程结构;课程教学实施教、学、做一体,坚持理论为实践服务的教学原则,通:过模拟企业“大数据分析”环境进行组织,锻炼学生的实践操作能力。
(二)具体目标与要求
1.素质目标:
(1)培养学生对大数据技术的兴趣和热情,激发他们对数据管理和分析的实际应用的兴趣。
(2)培养学生团队合作、问题解决和创新思维的能力,以应对复杂的大数据处理和分析挑战。
(3)提升学生的数据驱动决策能力和跨学科应用能力,使其能够在多领域的数据驱动环境中发挥作用。
2.知识目标:
(1)理解大数据的概念、特征及其在不同领域中的应用。
(2)掌握Hadoop平台的基本架构、组件及其功能,如HDFS、MapReduce、YARN等。
(3)理解大数据处理中的数据采集、存储、处理和分析等关键技术和流程。
(4)熟悉常见的大数据处理工具和框架,如Hive、Spark、Kafka等,以及它们的应用场景和优缺点。
3.能力目标:
(1)能够设计和实施基于Hadoop平台的大数据处理解决方案,包括数据的采集、存储、处理和分析。
(2)能够通过MapReduce编程模型解决大规模数据处理问题,优化和调试MapReduce作业。
(3)能够利用Hive进行数据仓库建设和SQL查询,进行数据分析和报表生成。
(4)能够利用Spark进行实时数据处理和复杂分析任务,理解其在大数据处理中的优势和适用性。
四、课程内容与结构
(一)职业能力与课程内容
表2 职业能力与课程内容
|
工作内容 |
职业能力分析 |
支撑能力的知识技能 |
|
组件安装与配置 |
掌握Linux操作系统的使用,了解Hadoop的架构,能够进行网络配置和故障排查 |
Linux系统管理,Shell脚本编写,Java基础,Hadoop的组成与原理,网络基础知识 |
|
数据采集与存储 |
能够使用工具进行数据采集,对HDFS的文件组织方式有深入理解 |
数据采集工具使用,如Flume、Sqoop;了解文件系统原理,特别是HDFS的工作原理 |
|
数据处理 |
具备强大的编程能力,能够设计和实现数据处理算法 |
熟练掌握HadoopMapReduce编程,熟悉Spark及RDD操作,了解数据处理算法和数据结构 |
|
数据分析 |
懂得统计学基础,掌握至少一种编程语言(如Python),并能够使用相关机器学习库 |
统计分析方法,机器学习基本概念和算法,Python或Scala编程,使用MLlib等库的经验 |
(二)课程结构与学时安排
《Hadoop平台搭建与应用》课程共计32学时,分5个模块,每个模块按照工作内容分为若干任务,每一个任务承载一定学习内容,具体如下表:
表3 课程结构及学时安排
|
模块 |
任务 |
学习内容 |
学时 |
|
|
模块一:大数据基础知识 |
任务一理解大数据的基本概念和特征 |
2学时 |
1.大数据的定义、发展历程、应用领域和未来趋势 2.认识Hadoop的发展历程、核心组件(HDFS、MapReduce、YARN等)及架构 3.了解大数据处理流程及Hadoop的使用场景 |
4 |
|
任务二了解大数据处理流程及Hadoop的使用场景 |
2学时 |
|||
|
实践安装Hadoop单机版,进行简单的配置和运行 |
2学时 |
安装并配置Hadoop大数据开发环境 |
2 |
|
|
模块二:Linux系统与网络基础 |
任务一掌握Linux操作系统的基本使用 |
2学时 |
1.Linux常用命令、文件系统管理、用户及权限设置 2.网络协议基础、IP地址和子网划分、SSH远程访问 3.在Linux系统中安装必要软件,如JDK、Hadoop等 |
4 |
|
任务二实践Linux系统下的软件安装和配置 |
2学时 |
|||
|
实践配置Linux系统的网络,实现远程访问和文件传输 |
2学时 |
配置Linux系统的网络,实现远程访问和文件传输,并具备基本的网络安全意识和故障排除能力 |
4 |
|
|
模块三:Hadoop安装与配置 |
任务一学习Hadoop的安装步骤和配置方法 |
2学时 |
1.Hadoop的伪分布式和完全分布式安装,基本配置 2.HDFS、MapReduce、YARN的工作原理和配置 3.Hadoop集群的性能调优,包括硬件选择和软件配置 |
4 |
|
任务二理解Hadoop的体系结构和核心组件 |
2学时 |
|||
|
实践实际搭建Hadoop伪分布式集群,进行基本操作 |
2学时 |
搭建Hadoop伪分布式集群,并进行基本的数据操作和集群管理 |
2 |
|
|
模块四:数据采集与存储 |
任务一学习使用数据采集工具 |
2学时 |
1.Sqoop和Flume的安装、配置和使用 2.HDFS的文件格式,如序列文件、Parquet等 3.从关系型数据库采集数据并存储到HDFS中 |
4 |
|
任务二理解数据存储的格式和结构 |
2学时 |
|||
|
实践使用Sqoop和Flume采集数据,存储到HDFS,并进行文件管理 |
2学时 |
使用Sqoop和Flume采集数据,并将其存储到HDFS中,同时能够对HDFS中的文件进行基本管理 |
2 |
|
|
模块五:MapReduce编程 |
任务一理解MapReduce编程模型 |
2学时 |
1.MapReduce的基本原理,编程模型的核心概念 2.编写简单的WordCount程序,了解MapReduce的API 3.MapReduce程序的性能优化技巧 |
4 |
|
任务二编写和调试MapReduce程序 |
2学时 |
|||
|
实践开发一个自定义的MapReduce作业,并在Hadoop集群上运行 |
2学时 |
1.定义Map和Reduce函数以及数据的输入输出格式 2.配置Hadoop环境,设置必要的环境变量和配置文件 3.使用日志和Hadoop提供的工具进行作业调试 |
2 |
|