一、课程信息
表1 课程信息表
|
课程名称(学时) |
Spark大数据分析与应用 (64学时) |
开课院部 |
人工智能学院 |
|
课程代码 |
ZN0070Z |
适用专业及专业代码 |
大数据技术 510205 |
|
课程属性 |
□公共基础平台课程□ 专业(群)平台基础课程 ☑专业(群)专业课程 |
||
|
课程性质 |
☑ 必修课 □限选课 □任选课 |
||
|
考核形式 |
③技能测试,⑦项目(方案)设计 |
||
|
前导课程 |
《Python编程基础》 |
||
|
后续课程 |
《机器学习》 |
||
考核形式:①闭卷,②开卷,③技能测试,④面试(含答辩、口试、表演等),⑤小论文,⑥报告(含读书报告、调查报告、实习报告等),⑦项目(方案)设计,⑧课程实践,⑨其它。
二、课程性质与任务
(一)课程性质
《Spark大数据分析与应用》课程旨在培养学生在大数据环境下的分析能力和应用技能。面向计算机及相关专业,课程系统讲解Apache Spark的基本概念、架构及其在大数据处理中的应用。学生将深入理解大数据特征与处理流程,掌握Spark的核心组件,如Spark SQL、Spark Streaming和MLlib。
课程采用项目驱动的学习方式,学生将在实际案例中进行数据清洗、转换与分析,熟悉使用Spark进行大规模数据计算的流程。通过学习,学生将具备数据驱动决策能力,提高解决复杂问题的综合素质与实践能力。最终,课程旨在为学生提供坚实的理论基础和丰富的实践经验,以适应快速发展的大数据行业需求。
(二)教学任务
《Spark大数据分析与应用》课程的教学任务是使学生掌握大数据分析的基础理论、Apache Spark的核心技术及其应用。通过课堂讲授、案例分析和实践操作相结合的方式,学生将学习Spark的基本架构、数据处理流程及其关键组件,如Spark SQL、Spark Streaming和MLlib。课程将强调数据清洗、转换与分析的实用技能,培养学生运用Spark进行数据驱动决策的能力。此外,课程将通过项目驱动学习,让学生在真实数据集上进行分析与可视化,锻炼他们的团队协作和问题解决能力。最终,学生将能够独立完成大规模数据分析任务,为进入大数据行业或相关岗位打下坚实的专业基础。
三、课程目标与要求
(一)总体目标与要求
《Spark大数据分析与应用》课程以培养学生的大数据分析能力与数据驱动决策能力为核心目标,强调理论与实践相结合、技术与应用融合的教学理念。课程通过系统的教学与项目化实训,使学生掌握大数据分析的基本原理、Apache Spark的操作技能与数据处理流程,具备根据不同应用场景进行数据分析、模型构建与结果呈现的能力。课程旨在培养学生良好的职业素养、分析能力与创新精神,使其能够适应现代数据科学、商业智能、数据工程等行业的岗位需求,为后续专业学习与职业发展奠定坚实基础。
(二)具体目标与要求
素质目标:培养学生认真严谨的工作态度与团队协作精神,树立职业责任感与数据伦理意识,提升分析思维与数据表达能力。
知识目标:掌握大数据分析的基本理论知识,包括数据预处理、特征工程、模型评估等要素原理;了解常用Spark组件及操作规范;熟悉数据分析流程与机器学习基础。
能力目标:具备独立完成数据分析任务的能力,能够针对不同主题或场景进行数据采集、分析模型构建与结果解释,初步具备数据可视化与报告生成的综合应用能力。
四、课程内容与结构
(一)职业能力与课程内容
表2 职业能力与课程内容
工作内容
职业能力分析
支撑能力的知识技能
数据采集与预处理
能够利用Spark生态中的相关工具(如Spark SQL、Spark Streaming等)进行数据的采集、清洗、整合与初步分析;具备处理大规模数据集的能力
掌握数据采集原理与常用技术(Flume、Kafka等);理解数据格式转换与ETL流程;熟悉Spark中DataFrame与RDD的基本操作
分布式计算与任务调度
能够基于Spark分布式计算框架进行任务划分与执行;具备分析并优化计算任务性能的能力
理解Spark的集群架构、RDD计算模型及执行原理;掌握任务划分、Shuffle机制、缓存与容错机制;了解任务调度策略与性能优化方法
数据存储与管理
能够在不同的存储系统(如HDFS、Hive等)中管理与调用数据;能合理设计数据存储方案以支持高效分析
掌握HDFS文件系统的原理与使用方法;熟悉Hive表管理与SQL操作;了解数据分区、索引及数据压缩策略
数据分析与挖掘
能够运用Spark MLlib等工具进行数据分析与建模,挖掘数据中的规律与趋势
掌握统计分析、聚类、分类、回归等基础算法;熟悉Spark MLlib机器学习框架及模型评估方法;理解特征工程与模型优化思路
实时数据处理与应用开发
能够使用Spark Streaming或Structured Streaming实现实时数据处理与监控应用;能进行大数据应用的简单开发与部署
掌握实时数据流的原理与处理流程;熟悉Spark Streaming编程接口;了解Kafka与Spark Streaming的集成方法;具备应用开发与测试能力
数据可视化与结果展示
能够对分析结果进行可视化展示与报告撰写,具备将技术成果转化为决策依据的能力
掌握数据可视化工具(Tableau、ECharts等)的使用;了解图表类型与表达方式;能撰写分析报告与展示PPT
数据采集与预处理
能够利用Spark生态中的相关工具(如Spark SQL、Spark Streaming等)进行数据的采集、清洗、整合与初步分析;具备处理大规模数据集的能力
掌握数据采集原理与常用技术(Flume、Kafka等);理解数据格式转换与ETL流程;熟悉Spark中DataFrame与RDD的基本操作
(二)课程结构与学时安排
《Spark大数据分析与应用》课程共计64学时,分6个模块,每个项目按照工作内容分为若干任务,每一个任务承载一定学习内容,具体如下表:
表3 课程结构及学时安排
|
模块 |
任务 |
学习内容 |
学时 |
|
|
模块一:大数据与Spark基础认知 |
项目1:理解大数据技术背景与应用场景 |
4学时 |
大数据概念、特征及典型行业应用;大数据生态体系简介 |
8 |
|
项目2:认识Spark的发展与优势 |
4学时 |
Spark的发展历程、与Hadoop对比、核心特性 |
||
|
模块二:Spark运行原理与开发环境搭建 |
项目1:掌握Spark体系架构 |
4学时 |
Spark核心组件(Driver、Executor、Cluster Manager)及执行机制 |
8 |
|
项目2:搭建Spark开发与运行环境 |
4学时 |
本地模式、Standalone集群配置;与HDFS集成 |
||
|
模块三:Spark RDD编程基础 |
项目1:创建与操作RDD |
4学时 |
RDD的创建方式、Transformation与Action操作 |
12 |
|
项目2:掌握RDD的持久化与依赖 |
4学时 |
宽依赖、窄依赖、RDD缓存与Checkpoint机制 |
||
|
项目3:实现典型数据计算案例 |
4学时 |
词频统计、日志分析等基础案例 |
||
|
模块四:DataFrame、Dataset与Spark SQL |
项目1:理解结构化数据处理模型 |
4学时 |
DataFrame与Dataset概念、Schema定义 |
12 |
|
项目2:掌握Spark SQL编程与优化 |
4学时 |
SQL语法、UDF/UDAF自定义函数、执行计划优化 |
||
|
项目3:整合多数据源 |
4学时 |
JSON、CSV、Hive等数据源的读取与保存 |
||
|
模块五:Spark Streaming与实时计算 |
项目1:掌握流式数据处理基本概念 |
4学时 |
DStream与结构化流的区别、窗口操作 |
8 |
|
项目2:实现实时日志分析项目 |
4学时 |
实时数据接入、Kafka连接、结果展示 |
||
|
模块六:综合项目实训与应用拓展 |
项目1:项目选题与数据准备 |
4学时 |
团队项目立项、数据采集与清洗 |
16 |
|
项目2:Spark综合分析与可视化展示 |
8学时 |
结合Spark SQL与Streaming完成数据建模、结果分析与可视化 |
||
|
项目3:项目汇报与成果评价 |
4学时 |
小组展示、教师点评与课程总结 |
||