数据预处理技术 2026-2027-1 开篇-课程介绍

《数据预处理技术》课程介绍

一、课程基本介绍

1. 课程名称

数据预处理技术(Data Preprocessing Technology)

2. 课程性质

《数据预处理技术》是一门面向计算机、信息技术、大数据、人工智能等相关专业开设的专业基础课程

本课程主要研究如何利用 Python 编程技术,对来源复杂、格式多样、质量参差不齐的数据进行加工处理,使其转化为适用于数据分析、数据挖掘和机器学习的数据资源。

课程以 Python 语言为基础,以实际数据处理任务为导向,通过理论讲解、代码实践和综合项目训练,使学生掌握数据预处理的基本思想、方法和工程实践能力。

课程强调"理论学习 + 工具应用 + 项目实践"的融合,通过案例驱动方式培养学生解决真实数据问题的能力。


二、课程定位与作用

在大数据时代,企业和科研机构每天都会产生大量数据。然而,现实中的原始数据通常存在:

  • 数据缺失
  • 数据重复
  • 数据格式不统一
  • 数据异常
  • 数据噪声
  • 数据规模过大
  • 数据结构复杂

等问题,无法直接用于分析和建模。

因此,在数据分析、机器学习和人工智能应用流程中,数据预处理是不可缺少的重要环节。

本课程承担着连接:

Python程序设计 → 数据预处理 → 数据分析 → 机器学习/人工智能

这一学习链条的重要作用。

根据教学大纲,本课程的核心任务是通过数据清洗、数据集成、数据变换、数据规约等技术,将原始数据转换为可直接使用的高质量数据,为后续课程学习提供基础。

课程定位如下:

项目 内容
面向专业 计算机、大数据、人工智能相关专业
课程性质 专业基础课
学分 3学分
学时 48学时
前导课程 Python程序设计
后续课程 Python数据分析、机器学习、自然语言处理

三、课程教学理念

本课程采用"理实一体化"的教学理念。

即:

理论知识学习 + 编程实践训练 + 企业案例应用

三者结合。

课程设计突出:

  1. 以能力培养为核心

不只要求学生理解数据预处理概念,更要求能够利用 Python 工具解决实际数据问题。

  1. 以项目案例为驱动

通过真实案例,例如:

  • 用户行为分析
  • 文本数据分析
  • 数据清洗任务

培养学生的数据处理能力。

  1. 以工具应用为重点

重点学习:

  • NumPy
  • Pandas
  • Matplotlib
  • Scikit-learn
  • Jieba
  • WordCloud

等 Python 数据处理工具。

教学大纲指出,本课程采用 Jupyter Notebook 作为主要开发工具,通过案例教学帮助学生掌握数据处理流程和技能。


四、课程教学目标

通过本课程学习,学生能够达到以下目标。


(一)知识目标

学生能够:

1. 理解数据预处理基本概念

包括:

  • 什么是数据预处理
  • 为什么需要数据预处理
  • 数据质量问题
  • 数据处理流程

2. 掌握数据处理基本方法

包括:

  • 数据获取
  • 数据存储
  • 数据清洗
  • 数据集成
  • 数据变换
  • 数据规约

3. 理解 Python 数据处理工具

掌握:

  • NumPy
  • Pandas
  • Scikit-learn

等工具的基本使用。


(二)能力目标

学生能够:

1. 完成数据读取与管理

例如:

  • CSV 文件读取
  • Excel 数据读取
  • 数据库数据读取
  • 网络数据获取

2. 完成数据质量处理

能够处理:

  • 缺失值
  • 重复值
  • 异常值
  • 格式错误

3. 完成数据转换

包括:

  • 数据标准化
  • 数据离散化
  • 特征构造
  • 数据编码

4. 完成综合数据处理项目

能够针对真实数据完成:

数据分析 → 数据处理 → 数据建模前准备

完整流程。


五、课程知识体系设计

本课程共分为八个教学模块。

总体结构:

复制代码
Python基础
     ↓
数据获取
     ↓
数据清洗
     ↓
数据集成
     ↓
数据变换
     ↓
数据规约
     ↓
综合项目实践
     ↓
人工智能数据准备

课程共48学时,具体章节安排如下:

章节 内容 学时
第一章 初识Python数据预处理 6
第二章 数据获取与存储 5
第三章 数据清洗 6
第四章 数据集成 6
第五章 数据变换 8
第六章 数据规约 4
第七章 家用热水器用户行为分析实战 6
第八章 中华古诗词文本分析实战 7

六、章节教学内容详细介绍

第一章 初识Python数据预处理(6学时)

教学目标

学生了解:

  • 数据预处理概念
  • 数据质量问题
  • 数据处理流程
  • Python开发环境

掌握:

  • Anaconda环境配置
  • Jupyter Notebook使用
  • 数据处理工具安装

主要内容

1. 数据预处理基础

介绍:

  • 数据生命周期
  • 数据分析流程
  • 数据预处理作用

2. 常见数据问题

例如:

原始数据:

姓名 年龄 成绩
张三 20 90
李四 null 85
王五 20 90

存在:

  • 缺失
  • 重复
  • 异常

3. Python数据工具环境

学习:

  • Anaconda
  • Jupyter Notebook
  • NumPy
  • Pandas

第二章 数据获取与存储(5学时)

教学目标

掌握:

  • 数据来源
  • 数据读取
  • 数据存储

主要内容

数据来源

包括:

  • 文件数据
  • 网络数据
  • 数据库数据

常见格式

例如:

  • CSV
  • Excel
  • JSON
  • TXT

网络数据获取

学习:

  • 网络爬虫基本原理
  • 数据采集流程

数据库存储

包括:

  • MySQL
  • 数据读取
  • 数据写入

第三章 数据清洗(6学时)

数据清洗是数据预处理中最重要的环节之一。

主要解决:

"数据是否正确?"

的问题。

教学重点包括:

  • 缺失值处理
  • 重复值处理
  • 异常值处理
  • 时间格式处理

典型技术

缺失值处理

方法:

  • 删除
  • 填充
  • 插值

Python:

python 复制代码
data.fillna()
data.dropna()
data.interpolate()

异常值检测

方法:

  • 3σ原则
  • 箱型图

第四章 数据集成(6学时)

目标:

将多个来源的数据合并成为统一数据集。

学习:

  • merge()
  • join()
  • concat()
  • combine()

等方法。


应用:

例如:

用户信息表:

复制代码
用户编号 姓名
001 张三

订单表:

复制代码
用户编号 金额
001 500

通过数据集成形成:

复制代码
用户编号 姓名 金额
001 张三 500

第五章 数据变换(8学时)

本章是课程重点。

学习:

  • 数据规范化
  • 数据离散化
  • 特征构造
  • 数据聚合
  • 数据重塑

主要方法:

标准化

例如:

  • Min-Max
  • Z-score

数据分组

学习:

python 复制代码
groupby()
agg()

数据透视

学习:

python 复制代码
pivot()
melt()

第六章 数据规约(4学时)

目标:

降低数据规模,提高处理效率。

主要包括:

属性规约

减少字段数量。

数值规约

减少数据量。

PCA降维

利用主成分分析降低维度。


第七章 综合实践:家用热水器用户行为分析(6学时)

这是企业案例实践。

学生完成:

  1. 数据探索

  2. 数据质量分析

  3. 数据清洗

  4. 数据变换

  5. 特征构造

  6. 模型建立

  7. 模型评价

课程要求学生掌握:

  • 数据处理流程
  • 数据分析方法
  • BP神经网络基础

第八章 综合实践:中华古诗词文本分析(7学时)

主要面向自然语言处理方向。

学习:

  • 中文分词
  • Jieba工具
  • 关键词提取
  • 去停用词
  • 词云生成

最终实现:

复制代码
古诗文本
 ↓
分词
 ↓
关键词提取
 ↓
词频统计
 ↓
词云展示

七、教学环境要求

课程实践环境:

操作系统:

  • Windows 10

开发工具:

  • Anaconda3
  • Jupyter Notebook

八、教学方法

采用:

1. 理论讲授

讲解:

  • 数据处理思想
  • 算法原理
  • 方法特点

2. 案例教学

通过真实项目学习。

3. 上机实践

学生完成:

  • Python代码编写
  • 数据处理实验
  • 项目任务

课程采用"课堂授课 + 上机实践"的方式,其中课堂强调知识理解,上机强调程序实现。


九、课程考核方式

课程采用考试方式。

成绩组成:

项目 比例
平时成绩 50%
期末考试 50%

其中:

平时成绩:

  • 作业 30%
  • 实验和上机 20%

十、课程学习成果

完成本课程后,学生能够:

✅ 理解数据预处理完整流程

✅ 熟练使用 Python 数据处理工具

✅ 能够清洗真实业务数据

✅ 能够完成数据整合与转换

✅ 能够为机器学习模型准备数据

✅ 具备初步的数据工程实践能力


相关推荐
pjj198541 分钟前
机器学习-NumPy2
人工智能·python·机器学习
doudoudalao13 分钟前
2026年AI生成电商带货视频工具有哪些?TikTok带货素材生产方案与对比
大数据·人工智能
OPEN-F14 分钟前
Python进阶教程:单元测试与代码质量
开发语言·python·单元测试
Bode_200234 分钟前
智能制造系统(SoI)中“3I”指什么
大数据·人工智能
Logintern0935 分钟前
装饰器和洋葱模式的区分
开发语言·python·架构
呆呆敲代码的小Y1 小时前
10 分钟搞懂 cua:开源 AI 操作电脑基础设施,附 Python 沙箱与 Agent 上手代码
人工智能·python·开源·ai agent·awesome·llm应用·cua
工具分享1 小时前
带店托管必用爆单AI选品,一人公司轻松掌握
人工智能·python
l1258651 小时前
# RAG低延迟架构设计:从5秒到500ms的优化全链路
数据库·人工智能·python·langchain
杨丰玮4181 小时前
从零手写Java飞机躲障碍游戏|Swing绘图、鼠标跟随、计时器碰撞检测实战(五)
java·python·游戏·游戏引擎·图形渲染·动画·贴图
frjc1 小时前
阿里云 ACK 环境 Arthas 在线调试指南
开发语言·python