HCIA-AI人工智能笔记3:数据预处理

统讲解数据预处理的核心技术体系,通过Python/Pandas与华为MindSpore双视角代码演示,结合特征工程优化实验,深入解析数据清洗、标准化、增强等关键环节。

一、数据预处理技术全景图

复制代码
graph TD
A[原始数据] --> B{数据清洗}
B --> B1[缺失值处理]
B --> B2[异常值检测]
B --> B3[重复值删除]
A --> C{特征工程}
C --> C1[标准化/归一化]
C --> C2[离散化分箱]
C --> C3[特征交叉]
A --> D{数据增强}
D --> D1[图像变换]
D --> D2[文本增强]
D --> D3[SMOTE过采样]

二、结构化数据预处理实战

1. 数据清洗技术矩阵

问题类型 | 处理方法 | 华为ModelArts工具链

缺失值 | KNN插值/多重填充 | DSW数据清洗工作台

异常值 | 3σ原则/IQR检测 | ModelArts异常检测API

重复值 | 基于主键去重 | 分布式Deduplicate算子
Python代码示例:

复制代码
import pandas as pd
from sklearn.impute import KNNImputer

# 加载华为消费者数据集
data = pd.read_csv('huawei_sales.csv')

# KNN缺失值填充(k=3)
imputer = KNNImputer(n_neighbors=3)
data[['age', 'income']] = imputer.fit_transform(data[['age', 'income']])

# IQR异常值处理
Q1 = data['sales'].quantile(0.25)
Q3 = data['sales'].quantile(0.75)
data = data[~((data['sales'] < (Q1 - 1.5*IQR)) | (data['sales'] > (Q3 + 1.5*IQR)))]

三、分布式数据预处理优化

1. 昇腾平台加速方案

复制代码
# 启用硬件加速
from mindspore.dataset import config
config.set_enable_shared_mem(False)  # 关闭共享内存提升性能
config.set_numa_enable(True)         # 启用NUMA优化

# 分布式数据加载
dataset = ds.ImageFolderDataset(dataset_dir, num_parallel_workers=16, 
                               shuffle=True, num_shards=8, shard_id=rank)

2. 性能对比实验

四、预处理流水线构建

1. 端到端Pipeline示例

复制代码
from sklearn.pipeline import Pipeline
from sklearn.compose import ColumnTransformer

num_pipe = Pipeline([
    ('imputer', KNNImputer()),
    ('scaler', StandardScaler())
])

cat_pipe = Pipeline([
    ('encoder', TargetEncoder())
])

preprocessor = ColumnTransformer([
    ('num', num_pipe, ['age', 'income']),
    ('cat', cat_pipe, ['city'])
])

# 华为ModelArts一键部署
from modelarts.pipeline import deploy_pipeline
deploy_pipeline(preprocessor, name='sales_preprocessor')

掌握数据预处理技术是构建高质量AI模型的基础,建议重点实践:

构建自动化特征工程流水线

实现TB级数据的分布式处理

优化端侧推理数据预处理耗时

欢迎在评论区提交您的数据预处理挑战案例或性能优化方案!

想要快人一步了解更详细的内容可以搜索"博睿谷"

相关推荐
雅欣鱼子酱1 小时前
USB Type-C PD取电(诱骗,诱电,SINK),筋膜枪专用取电芯片
网络·人工智能·芯片·电子元器件
kisshuan123967 小时前
【深度学习】使用RetinaNet+X101-32x4d_FPN_GHM模型实现茶芽检测与识别_1
人工智能·深度学习
Learn Beyond Limits7 小时前
解构语义:从词向量到神经分类|Decoding Semantics: Word Vectors and Neural Classification
人工智能·算法·机器学习·ai·分类·数据挖掘·nlp
崔庆才丨静觅7 小时前
0代码生成4K高清图!ACE Data Platform × SeeDream 专属方案:小白/商家闭眼冲
人工智能·api
哥布林学者8 小时前
吴恩达深度学习课程五:自然语言处理 第一周:循环神经网络 (六)长短期记忆 LSTM
深度学习·ai
qq_356448378 小时前
机器学习基本概念与梯度下降
人工智能
水如烟8 小时前
孤能子视角:关系性学习,“喂饭“的小孩认知
人工智能
徐_长卿8 小时前
2025保姆级微信AI群聊机器人教程:教你如何本地打造私人和群聊机器人
人工智能·机器人
XyX——9 小时前
【福利教程】一键解锁 ChatGPT / Gemini / Spotify 教育权益!TG 机器人全自动验证攻略
人工智能·chatgpt·机器人
AI大模型应用之禅9 小时前
全球股市估值与可持续农业垂直种植技术的关系
网络·ai