看球直播App官网

人工智能学院

Spark大数据分析与应用

2026-05-19 219

一、课程信息

1 课程信息表

课程名称(学时)

Spark大数据分析与应用

64学时)

开课院部

人工智能学院

课程代码

ZN0070Z

适用专业及专业代码

大数据技术

510205

课程属性

□公共基础平台课程□ 专业(群)平台基础课程 ☑专业(群)专业课程

课程性质

☑ 必修课 □限选课 □任选课

考核形式

③技能测试⑦项目(方案)设计

前导课程

Python编程基础》

后续课程

《机器学习》

考核形式:①闭卷,②开卷,③技能测试,④面试(含答辩、口试、表演等),⑤小论文,⑥报告(含读书报告、调查报告、实习报告等),⑦项目(方案)设计,⑧课程实践,⑨其它。

二、课程性质与任务

(一)课程性质

Spark大数据分析与应用》课程旨在培养学生在大数据环境下的分析能力和应用技能。面向计算机及相关专业,课程系统讲解Apache Spark的基本概念、架构及其在大数据处理中的应用。学生将深入理解大数据特征与处理流程,掌握Spark的核心组件,如Spark SQL、Spark Streaming和MLlib。

课程采用项目驱动的学习方式,学生将在实际案例中进行数据清洗、转换与分析,熟悉使用Spark进行大规模数据计算的流程。通过学习,学生将具备数据驱动决策能力,提高解决复杂问题的综合素质与实践能力。最终,课程旨在为学生提供坚实的理论基础和丰富的实践经验,以适应快速发展的大数据行业需求。

(二)教学任务

Spark大数据分析与应用》课程的教学任务是使学生掌握大数据分析的基础理论、Apache Spark的核心技术及其应用。通过课堂讲授、案例分析和实践操作相结合的方式,学生将学习Spark的基本架构、数据处理流程及其关键组件,如Spark SQL、Spark Streaming和MLlib。课程将强调数据清洗、转换与分析的实用技能,培养学生运用Spark进行数据驱动决策的能力。此外,课程将通过项目驱动学习,让学生在真实数据集上进行分析与可视化,锻炼他们的团队协作和问题解决能力。最终,学生将能够独立完成大规模数据分析任务,为进入大数据行业或相关岗位打下坚实的专业基础。

三、课程目标与要求

(一)总体目标与要求

Spark大数据分析与应用》课程以培养学生的大数据分析能力与数据驱动决策能力为核心目标,强调理论与实践相结合、技术与应用融合的教学理念。课程通过系统的教学与项目化实训,使学生掌握大数据分析的基本原理、Apache Spark的操作技能与数据处理流程,具备根据不同应用场景进行数据分析、模型构建与结果呈现的能力。课程旨在培养学生良好的职业素养、分析能力与创新精神,使其能够适应现代数据科学、商业智能、数据工程等行业的岗位需求,为后续专业学习与职业发展奠定坚实基础。

(二)具体目标与要求

素质目标:培养学生认真严谨的工作态度与团队协作精神,树立职业责任感与数据伦理意识,提升分析思维与数据表达能力。

知识目标:掌握大数据分析的基本理论知识,包括数据预处理、特征工程、模型评估等要素原理;了解常用Spark组件及操作规范;熟悉数据分析流程与机器学习基础。

能力目标:具备独立完成数据分析任务的能力,能够针对不同主题或场景进行数据采集、分析模型构建与结果解释,初步具备数据可视化与报告生成的综合应用能力。

四、课程内容与结构

(一)职业能力与课程内容

2 职业能力与课程内容

工作内容

职业能力分析

支撑能力的知识技能

数据采集与预处理

能够利用Spark生态中的相关工具(如Spark SQLSpark Streaming等)进行数据的采集、清洗、整合与初步分析;具备处理大规模数据集的能力

掌握数据采集原理与常用技术(FlumeKafka等);理解数据格式转换与ETL流程;熟悉SparkDataFrameRDD的基本操作

分布式计算与任务调度

能够基于Spark分布式计算框架进行任务划分与执行;具备分析并优化计算任务性能的能力

理解Spark的集群架构、RDD计算模型及执行原理;掌握任务划分、Shuffle机制、缓存与容错机制;了解任务调度策略与性能优化方法

数据存储与管理

能够在不同的存储系统(如HDFSHive等)中管理与调用数据;能合理设计数据存储方案以支持高效分析

掌握HDFS文件系统的原理与使用方法;熟悉Hive表管理与SQL操作;了解数据分区、索引及数据压缩策略

数据分析与挖掘

能够运用Spark MLlib等工具进行数据分析与建模,挖掘数据中的规律与趋势

掌握统计分析、聚类、分类、回归等基础算法;熟悉Spark MLlib机器学习框架及模型评估方法;理解特征工程与模型优化思路

实时数据处理与应用开发

能够使用Spark StreamingStructured Streaming实现实时数据处理与监控应用;能进行大数据应用的简单开发与部署

掌握实时数据流的原理与处理流程;熟悉Spark Streaming编程接口;了解KafkaSpark Streaming的集成方法;具备应用开发与测试能力

数据可视化与结果展示

能够对分析结果进行可视化展示与报告撰写,具备将技术成果转化为决策依据的能力

掌握数据可视化工具(TableauECharts等)的使用;了解图表类型与表达方式;能撰写分析报告与展示PPT

数据采集与预处理

能够利用Spark生态中的相关工具(如Spark SQLSpark Streaming等)进行数据的采集、清洗、整合与初步分析;具备处理大规模数据集的能力

掌握数据采集原理与常用技术(FlumeKafka等);理解数据格式转换与ETL流程;熟悉SparkDataFrameRDD的基本操作

(二)课程结构与学时安排

Spark大数据分析与应用》课程共计64学时,分6个模块,每个项目按照工作内容分为若干任务,每一个任务承载一定学习内容,具体如下表:

3 课程结构及学时安排

模块

任务

学习内容

学时

模块一:大数据与Spark基础认知

项目1:理解大数据技术背景与应用场景

4学时

大数据概念、特征及典型行业应用;大数据生态体系简介

8

项目2:认识Spark的发展与优势

4学时

Spark的发展历程、与Hadoop对比、核心特性

模块二:Spark运行原理与开发环境搭建

项目1:掌握Spark体系架构

4学时

Spark核心组件(Driver、Executor、Cluster Manager)及执行机制

8

项目2搭建Spark开发与运行环境

4学时

本地模式、Standalone集群配置;与HDFS集成

模块三:Spark RDD编程基础

项目1:创建与操作RDD

4学时

RDD的创建方式、Transformation与Action操作

12

项目2:掌握RDD的持久化与依赖

4学时

宽依赖、窄依赖、RDD缓存与Checkpoint机制

项目3:实现典型数据计算案例

4学时

词频统计、日志分析等基础案例

模块四:DataFrame、Dataset与Spark SQL

项目1:理解结构化数据处理模型

4学时

DataFrame与Dataset概念、Schema定义

12

项目2:掌握Spark SQL编程与优化

4学时

SQL语法、UDF/UDAF自定义函数、执行计划优化

项目3:整合多数据源

4学时

JSON、CSV、Hive等数据源的读取与保存

模块五:Spark Streaming与实时计算

项目1:掌握流式数据处理基本概念

4学时

DStream与结构化流的区别、窗口操作

8

项目2:实现实时日志分析项目

4学时

实时数据接入、Kafka连接、结果展示

模块六:综合项目实训与应用拓展

项目1:项目选题与数据准备

4学时

团队项目立项、数据采集与清洗

16

项目2:Spark综合分析与可视化展示

8学时

结合Spark SQL与Streaming完成数据建模、结果分析与可视化

项目3:项目汇报与成果评价

4学时

小组展示、教师点评与课程总结