数据预处理技术 2026-2027-1 开篇-课程介绍

《数据预处理技术》课程介绍

一、课程基本介绍

1. 课程名称

数据预处理技术(Data Preprocessing Technology)

2. 课程性质

《数据预处理技术》是一门面向计算机、信息技术、大数据、人工智能等相关专业开设的专业基础课程

本课程主要研究如何利用 Python 编程技术,对来源复杂、格式多样、质量参差不齐的数据进行加工处理,使其转化为适用于数据分析、数据挖掘和机器学习的数据资源。

课程以 Python 语言为基础,以实际数据处理任务为导向,通过理论讲解、代码实践和综合项目训练,使学生掌握数据预处理的基本思想、方法和工程实践能力。

课程强调"理论学习 + 工具应用 + 项目实践"的融合,通过案例驱动方式培养学生解决真实数据问题的能力。


二、课程定位与作用

在大数据时代,企业和科研机构每天都会产生大量数据。然而,现实中的原始数据通常存在:

  • 数据缺失
  • 数据重复
  • 数据格式不统一
  • 数据异常
  • 数据噪声
  • 数据规模过大
  • 数据结构复杂

等问题,无法直接用于分析和建模。

因此,在数据分析、机器学习和人工智能应用流程中,数据预处理是不可缺少的重要环节。

本课程承担着连接:

Python程序设计 → 数据预处理 → 数据分析 → 机器学习/人工智能

这一学习链条的重要作用。

根据教学大纲,本课程的核心任务是通过数据清洗、数据集成、数据变换、数据规约等技术,将原始数据转换为可直接使用的高质量数据,为后续课程学习提供基础。

课程定位如下:

项目 内容
面向专业 计算机、大数据、人工智能相关专业
课程性质 专业基础课
学分 3学分
学时 48学时
前导课程 Python程序设计
后续课程 Python数据分析、机器学习、自然语言处理

三、课程教学理念

本课程采用"理实一体化"的教学理念。

即:

理论知识学习 + 编程实践训练 + 企业案例应用

三者结合。

课程设计突出:

  1. 以能力培养为核心

不只要求学生理解数据预处理概念,更要求能够利用 Python 工具解决实际数据问题。

  1. 以项目案例为驱动

通过真实案例,例如:

  • 用户行为分析
  • 文本数据分析
  • 数据清洗任务

培养学生的数据处理能力。

  1. 以工具应用为重点

重点学习:

  • NumPy
  • Pandas
  • Matplotlib
  • Scikit-learn
  • Jieba
  • WordCloud

等 Python 数据处理工具。

教学大纲指出,本课程采用 Jupyter Notebook 作为主要开发工具,通过案例教学帮助学生掌握数据处理流程和技能。


四、课程教学目标

通过本课程学习,学生能够达到以下目标。


(一)知识目标

学生能够:

1. 理解数据预处理基本概念

包括:

  • 什么是数据预处理
  • 为什么需要数据预处理
  • 数据质量问题
  • 数据处理流程

2. 掌握数据处理基本方法

包括:

  • 数据获取
  • 数据存储
  • 数据清洗
  • 数据集成
  • 数据变换
  • 数据规约

3. 理解 Python 数据处理工具

掌握:

  • NumPy
  • Pandas
  • Scikit-learn

等工具的基本使用。


(二)能力目标

学生能够:

1. 完成数据读取与管理

例如:

  • CSV 文件读取
  • Excel 数据读取
  • 数据库数据读取
  • 网络数据获取

2. 完成数据质量处理

能够处理:

  • 缺失值
  • 重复值
  • 异常值
  • 格式错误

3. 完成数据转换

包括:

  • 数据标准化
  • 数据离散化
  • 特征构造
  • 数据编码

4. 完成综合数据处理项目

能够针对真实数据完成:

数据分析 → 数据处理 → 数据建模前准备

完整流程。


五、课程知识体系设计

本课程共分为八个教学模块。

总体结构:

复制代码
Python基础
     ↓
数据获取
     ↓
数据清洗
     ↓
数据集成
     ↓
数据变换
     ↓
数据规约
     ↓
综合项目实践
     ↓
人工智能数据准备

课程共48学时,具体章节安排如下:

章节 内容 学时
第一章 初识Python数据预处理 6
第二章 数据获取与存储 5
第三章 数据清洗 6
第四章 数据集成 6
第五章 数据变换 8
第六章 数据规约 4
第七章 家用热水器用户行为分析实战 6
第八章 中华古诗词文本分析实战 7

六、章节教学内容详细介绍

第一章 初识Python数据预处理(6学时)

教学目标

学生了解:

  • 数据预处理概念
  • 数据质量问题
  • 数据处理流程
  • Python开发环境

掌握:

  • Anaconda环境配置
  • Jupyter Notebook使用
  • 数据处理工具安装

主要内容

1. 数据预处理基础

介绍:

  • 数据生命周期
  • 数据分析流程
  • 数据预处理作用

2. 常见数据问题

例如:

原始数据:

姓名 年龄 成绩
张三 20 90
李四 null 85
王五 20 90

存在:

  • 缺失
  • 重复
  • 异常

3. Python数据工具环境

学习:

  • Anaconda
  • Jupyter Notebook
  • NumPy
  • Pandas

第二章 数据获取与存储(5学时)

教学目标

掌握:

  • 数据来源
  • 数据读取
  • 数据存储

主要内容

数据来源

包括:

  • 文件数据
  • 网络数据
  • 数据库数据

常见格式

例如:

  • CSV
  • Excel
  • JSON
  • TXT

网络数据获取

学习:

  • 网络爬虫基本原理
  • 数据采集流程

数据库存储

包括:

  • MySQL
  • 数据读取
  • 数据写入

第三章 数据清洗(6学时)

数据清洗是数据预处理中最重要的环节之一。

主要解决:

"数据是否正确?"

的问题。

教学重点包括:

  • 缺失值处理
  • 重复值处理
  • 异常值处理
  • 时间格式处理

典型技术

缺失值处理

方法:

  • 删除
  • 填充
  • 插值

Python:

python 复制代码
data.fillna()
data.dropna()
data.interpolate()

异常值检测

方法:

  • 3σ原则
  • 箱型图

第四章 数据集成(6学时)

目标:

将多个来源的数据合并成为统一数据集。

学习:

  • merge()
  • join()
  • concat()
  • combine()

等方法。


应用:

例如:

用户信息表:

复制代码
用户编号 姓名
001 张三

订单表:

复制代码
用户编号 金额
001 500

通过数据集成形成:

复制代码
用户编号 姓名 金额
001 张三 500

第五章 数据变换(8学时)

本章是课程重点。

学习:

  • 数据规范化
  • 数据离散化
  • 特征构造
  • 数据聚合
  • 数据重塑

主要方法:

标准化

例如:

  • Min-Max
  • Z-score

数据分组

学习:

python 复制代码
groupby()
agg()

数据透视

学习:

python 复制代码
pivot()
melt()

第六章 数据规约(4学时)

目标:

降低数据规模,提高处理效率。

主要包括:

属性规约

减少字段数量。

数值规约

减少数据量。

PCA降维

利用主成分分析降低维度。


第七章 综合实践:家用热水器用户行为分析(6学时)

这是企业案例实践。

学生完成:

  1. 数据探索

  2. 数据质量分析

  3. 数据清洗

  4. 数据变换

  5. 特征构造

  6. 模型建立

  7. 模型评价

课程要求学生掌握:

  • 数据处理流程
  • 数据分析方法
  • BP神经网络基础

第八章 综合实践:中华古诗词文本分析(7学时)

主要面向自然语言处理方向。

学习:

  • 中文分词
  • Jieba工具
  • 关键词提取
  • 去停用词
  • 词云生成

最终实现:

复制代码
古诗文本
 ↓
分词
 ↓
关键词提取
 ↓
词频统计
 ↓
词云展示

七、教学环境要求

课程实践环境:

操作系统:

  • Windows 10

开发工具:

  • Anaconda3
  • Jupyter Notebook

八、教学方法

采用:

1. 理论讲授

讲解:

  • 数据处理思想
  • 算法原理
  • 方法特点

2. 案例教学

通过真实项目学习。

3. 上机实践

学生完成:

  • Python代码编写
  • 数据处理实验
  • 项目任务

课程采用"课堂授课 + 上机实践"的方式,其中课堂强调知识理解,上机强调程序实现。


九、课程考核方式

课程采用考试方式。

成绩组成:

项目 比例
平时成绩 50%
期末考试 50%

其中:

平时成绩:

  • 作业 30%
  • 实验和上机 20%

十、课程学习成果

完成本课程后,学生能够:

✅ 理解数据预处理完整流程

✅ 熟练使用 Python 数据处理工具

✅ 能够清洗真实业务数据

✅ 能够完成数据整合与转换

✅ 能够为机器学习模型准备数据

✅ 具备初步的数据工程实践能力


相关推荐
看昭奚恤哭2 小时前
ontainer App】Container App无法从Container Registries 拉取镜像 - 报错 Forbidden
后端·python·flask
Elastic 中国社区官方博客2 小时前
Elastic 和 OpenAI 合作,将前沿智能引入非结构化企业数据
大数据·数据库·人工智能·elasticsearch·搜索引擎·ai
0566462 小时前
Python康复训练——数据结构
数据结构·windows·python
听雨入夜2 小时前
“同声传译”还是“全文翻译”?为何HotSpot虚拟机仍要保留解释器?
开发语言·python
随风M记忆s2 小时前
GEE&Python-demo:利用Sentinel-监测北京奥林匹克森林公园年NDVI变化(附Python版)
开发语言·python·sentinel
软萌萌的12 小时前
Python零基础从入门到精通详细教程-数据类型
开发语言·windows·python
东北赵四3 小时前
关于Java泛型的知识点及其相关面试题
java·windows·python
姓蔡小朋友3 小时前
Java线程并发
java·开发语言·python
海带紫菜菠萝汤3 小时前
免费在线翻译器横评:2026年6款PDF翻译工具对比
人工智能·python·pdf