DuckDB数据分析实战:CSV文件导入导出

在数据分析领域,CSV(Comma-Separated Values)是一种非常通用的数据交换格式。无论是 Excel 导出的报表、业务系统产生的数据、日志文件,还是不同数据库之间的数据传输,CSV 常常都是首选格式。

DuckDB 作为近年来最受欢迎的分析型数据库之一,对于 CSV 格式提供了开箱即用的支持。它不仅能够直接查询 CSV 文件,还能够快速将 CSV 导入数据库表,或者将查询结果导出为 CSV 文件。

本文使用的示例文件 databases.csv 内容如下:

text 复制代码
name, type, version
sqlite, oltp, 3.53.3
duckdb, olap, 1.5.4
mysql, oltp, 9.7.0

直接读取 CSV 文件

DuckDB 可以自动识别 CSV 文件格式、列名和字段类型,因此很多场景下甚至不需要创建表,直接查询文件即可。其中,最标准的方式是使用 read_csv() 函数。例如:

sql 复制代码
SELECT * FROM read_csv('databases.csv');

┌─────────┬─────────┬─────────┐
│  name   │  type   │ version │
│ varchar │ varchar │ varchar │
├─────────┼─────────┼─────────┤
│ sqlite  │  oltp   │  3.53.3 │
│ duckdb  │  olap   │  1.5.4  │
│ mysql   │  oltp   │  9.7.0  │
└─────────┴─────────┴─────────┘

DuckDB 可以自动解析文件内容并推断字段类型。当然,我们也可以显式指定字段类型等参数。例如:

sql 复制代码
SELECT *
FROM read_csv(
    'databases.csv',
    delim = ',',
    header = true,
    columns = {
        'name': 'VARCHAR',
        'type': 'VARCHAR',
        'version': 'VARCHAR'
    }
);

其中,delim 用于指定字段分隔符,header 表示是否包含表头,columns 用于指定字段类型。

更多关于 read_csv() 函数参数的介绍,可以参考官方文档

不仅如此,DuckDB 还能够根据文件扩展名自动识别 CSV 文件,因此甚至可以省略 read_csv() 函数:

sql 复制代码
SELECT * FROM 'databases.csv';

# 使用FROM优先的查询语法
FROM 'databases.csv' SELECT *;

这种写法更加简洁,也是许多 DuckDB 用户的常用写法。

如果某个目录下包含多个格式类似的文件,可以使用通配符一次读取。例如:

sql 复制代码
SELECT *
FROM read_csv('data/*.csv');

DuckDB 会把多个文件的数据自动合并成一个结果。

CSV 文件导入数据表

如果想要长期保存数据,可以基于 CSV 文件创建数据库表并导入数据:

sql 复制代码
CREATE TABLE db AS
SELECT *
FROM read_csv('databases.csv');

SELECT * FROM db;

DuckDB 会自动基于 CSV 文件推断字段类型并创建表,然后导入全部数据,整个过程一步完成。

同样,我们也可以采用 FROM 优先的查询语法进一步简化语句:

sql 复制代码
CREATE TABLE db AS
FROM 'databases.csv';

另一种场景是目标表已经存在,可以使用 INSERT INTO 语句导入数据:

sql 复制代码
DELETE FROM db;

INSERT INTO db
SELECT * FROM read_csv('databases.csv');

针对大批量数据导入场景,DuckDB 还提供了专门的数据装载语句(COPY):

sql 复制代码
DELETE FROM db;

COPY db
FROM 'databases.csv';

数据导出到 CSV 文件

如果想要把表中的数据导出为 CSV 文件,可以使用 COPY 语句。例如:

sql 复制代码
COPY db TO 'output.csv' (HEADER, DELIMITER ',');

其中,output.csv 是文件名,HEADER 表示导出表头,DELIMITER 指定字段的分隔符。

另外,COPY 语句也可以用于导出查询结果。例如:

sql 复制代码
COPY (SELECT name, version FROM db)
TO 'output.csv' (HEADER, DELIMITER ',');

总结

DuckDB 对于 CSV 格式的支持非常完善,既可以直接查询 CSV 文件,也可以导入到数据库表中,还可以将查询结果或表数据导出为 CSV 文件。同时,它还具备 CSV 格式自动探测功能,可以识别分隔符、表头、数据类型等信息,因此大部分情况下无需手工配置。

相关推荐
XLYcmy19 小时前
PDF论文处理器 - 完整使用指南
pdf·llm·json·agent·token·csv·dify
SelectDB19 小时前
为什么越来越多分析数据库开始重视实时更新,而不仅仅是查询性能?
大数据·数据库·数据分析
SelectDB19 小时前
为什么今天值得重新比较 Apache Doris 和 StarRocks?
大数据·数据库·数据分析
shujudang20 小时前
B2B 官网获客数据如何与 CRM 线索状态关联
大数据·数据挖掘·数据分析
l1t20 小时前
DeepSeek总结的DuckDB 如何更快地运行递归 CTE
java·开发语言·数据库·mysql·duckdb
circuitsosk1 天前
多智能体协同在能源数据分析中的实践:分配-执行-校验闭环架构设计
python·数据分析·wpf·能源·并行计算·多智能体系统·agent协作
传感器与混合集成电路1 天前
分布式光纤测温DTS系统:ZDTS-P2000与X1000参数对比及找漏监测应用
分布式·数据分析
RE-19012 天前
电商互联网指标 - 归纳笔记
数据分析·电商指标·互联网指标·业务指标·指标解释
柳絮飞祭奠2 天前
Dify Windows Docker Desktop 部署文档
人工智能·深度学习·语言模型·数据分析·transformer·边缘计算·集成学习
数据狐(Datafox)2 天前
京东商品列表API技术解析与落地应用(含标准 JSON 示例)
java·大数据·前端·人工智能·python·数据分析·json