记一次用dataframe进行数据清理

总结一下dataframe读取数据库,以及整理数据的过程。分为三个部分:数据读取,数据整理以及数据写入。

1、数据读取

从csv读取读取数据,使用pandas读的read_csv函数,传入两个参数,分别是path文件路径,usecols读取的列表,返回的是dataframe格式。

python 复制代码
import pandas as pd

def csv_read(path, usecols):
    return pd.read_csv(path, usecols=usecols, encoding="gbk")

2、数据整理

我需要做清除空值,替换固定值,匹配关键词等操作。

1)清除空值很简单,按列替换空值,效率挺快。

python 复制代码
df.fillna(0, inplace=True)

2)替换固定值很简单, 按列替换空值,效率挺快

python 复制代码
df["s_serialno"] = df["s_serialno"].str.replace("'", "")

3)匹配关键词,由于多个关键词对多个内容,使用第一点的按列匹配就不行,我使用遍历方法

itertuples,其他的遍历方法可参见:Python - pandas DataFrame数据的合并与拼接(merge、join、concat)_pd.merge合并后顺序-CSDN博客

一开始我是匹配到不到关键词,就直接删除掉,测试小量数据还行,但面对几十万数据,频繁地让Dataframe删除数据,效率很低。于是作了如下改写,先将需要删作的idx保存下来,再一并删除。

python 复制代码
dropindex = []
keyword= 'XXXXX'

for obj in df.itertuples():
     idx = getattr(obj, "Index")
     if getattr(obj, "cnt") not in keyword.to_string():
            dropindex.append(idx)

df.drop(dropindex, inplace=True)

3、数据写入

使用dataframe.to_sql方法,开始的写法,为保证数据唯一性,避免主键重复出错,使用try except方法 ,一条一条录入,若主键重复直接pass即可。小量数据测试还行,面对几十万数据,单条录入,数据库与程序的I/O效率不高,数据录入缓慢。

python 复制代码
from sqlalchemy import create_engine

def mysql_engine():
    return create_engine("mysql+pymysql://root:10086@192.168.1.1:3306/order")

def write_sql(rows):
     # 使用逐条插入,而不用批量插入,用try-except判断避免重复插入的异常
     for i in range(len(df)):
         try:
             df.iloc[i : i + 1].to_sql(
                 name=table_name, con=mysql_engine(), if_exists="append", index=False
             )
         except Exception as e:
             # print(e)
             pass

于是我改用另一种方法:

使用原生sql语句,批量导入数据,使用ON DUPLICATE key UPDATE 避免主键重复出错。

python 复制代码
import pymysql

def getConn():
    return pymysql.connect(
        host="192.168.1.1", user="root", password="123456", database="order"
    )

def write_sql(rows):
    sql = (
        "insert into order.TABLE("
        "s_A,"
        "s_B"
        ") values(%s,%s)"
        "ON DUPLICATE key UPDATE s_B=values(s_B)"
    )
    conn = getConn()
    cur = conn.cursor()
    cur.executemany(sql, rows)
    conn.commit()
    cur.close()
    conn.close()
相关推荐
风哥2号6 小时前
数据库教程FGMT27‑MySQL数据库基础知识与体系架构
数据库·mysql
YangYang9YangYan7 小时前
2026 校招商品分析岗位 JD 拆解,核心指标、工具与面试考点
大数据·数据库·数据分析
西安栈上月明软件科技8 小时前
从业务黑话到本体图谱:OAG本体建模五步法(西安老系统AI化改造实战)
数据库·人工智能·架构
anxiao_m8 小时前
跨云跨机房大数据迁移怎么选?不同场景工具适配指南
数据库·云启快传
风哥2号10 小时前
数据库教程FGMT43‑MySQL性能分析与优化调整
数据库·mysql
随身数智备忘录10 小时前
财务数据分析如何与业务场景结合?财务数据分析如何从数出有据到数出有用?
数据库
这个DBA有点耶12 小时前
数据库教程:从零基础到实战的完整学习路径(2026版)
数据库·程序员·代码规范
forestsea12 小时前
从零构建 Java 智能体 RAG 系统:Milvus 向量数据库实战指南
java·数据库·milvus
probex_13 小时前
从 ByConity 到 VictoriaMetrics:一次指标数据迁移引发的四种存储对比
数据库
Patrick在香港13 小时前
Python 审计香港开放数据目录:两个端点差 10 倍,只有 9.3% 的资源标了「最后修改时间」
开发语言·数据库·python·数据分析·api·数据治理·开放数据