pandas库学习之merge函数

pandas库学习之merge函数

一、简介

pandas.merge函数用于合并两个DataFrame对象。它根据一个或多个键将两个DataFrame对象连接在一起,类似于SQL中的JOIN操作。

二、语法和参数

python 复制代码
pandas.merge(left, right, how='inner', on=None, left_on=None, right_on=None, left_index=False, right_index=False, sort=False, suffixes=('_x', '_y'), copy=True, indicator=False, validate=None)
参数:
  • left:第一个要合并的DataFrame对象。⭐
  • right:第二个要合并的DataFrame对象。⭐
  • how :字符串,默认值为inner,表示连接类型。可选值有leftrightouterinner。⭐
  • on :列名或列名的列表,表示用于连接的列。必须存在于左右两个DataFrame中。⭐
  • left_on:左侧DataFrame中用于连接的列名或索引级别。
  • right_on:右侧DataFrame中用于连接的列名或索引级别。
  • left_index:布尔值,表示是否使用左侧DataFrame的索引进行连接。
  • right_index:布尔值,表示是否使用右侧DataFrame的索引进行连接。
  • sort:布尔值,表示是否按连接键对结果进行排序。默认值为False。
  • suffixes :字符串元组,表示重复列名的后缀,默认值为(_x, _y)。
  • copy:布尔值,默认值为True,表示是否在合并数据时始终复制数据。
  • indicator:布尔值或字符串,表示是否添加一列指示每个行的来源。
  • validate :字符串,用于验证合并的类型。可选值有one_to_oneone_to_manymany_to_onemany_to_many

三、实例

3.1 内连接
python 复制代码
import pandas as pd

df1 = pd.DataFrame({
    'key': ['A', 'B', 'C', 'D'],
    'value1': [1, 2, 3, 4]
})

df2 = pd.DataFrame({
    'key': ['B', 'D', 'E', 'F'],
    'value2': [5, 6, 7, 8]
})

merged_df = pd.merge(df1, df2, on='key', how='inner')

print(merged_df)

输出:

复制代码
  key  value1  value2
0   B       2       5
1   D       4       6
3.2 左连接
python 复制代码
import pandas as pd

df1 = pd.DataFrame({
    'key': ['A', 'B', 'C', 'D'],
    'value1': [1, 2, 3, 4]
})

df2 = pd.DataFrame({
    'key': ['B', 'D', 'E', 'F'],
    'value2': [5, 6, 7, 8]
})

merged_df = pd.merge(df1, df2, on='key', how='left')

print(merged_df)

输出:

复制代码
  key  value1  value2
0   A       1     NaN
1   B       2     5.0
2   C       3     NaN
3   D       4     6.0
3.3 外连接
python 复制代码
import pandas as pd

df1 = pd.DataFrame({
    'key': ['A', 'B', 'C', 'D'],
    'value1': [1, 2, 3, 4]
})

df2 = pd.DataFrame({
    'key': ['B', 'D', 'E', 'F'],
    'value2': [5, 6, 7, 8]
})

merged_df = pd.merge(df1, df2, on='key', how='outer')

print(merged_df)

输出

复制代码
  key  value1  value2
0   A     1.0     NaN
1   B     2.0     5.0
2   C     3.0     NaN
3   D     4.0     6.0
4   E     NaN     7.0
5   F     NaN     8.0

四、注意事项

  1. 确保用于连接的键在两个DataFrame中都存在,否则结果会不如预期。
  2. 连接类型(如innerouterleftright)决定了合并结果的形状和内容。选择适当的连接类型非常重要。
  3. 使用suffixes参数可以避免在连接时因列名冲突而导致的问题。
  4. 如果需要使用索引进行连接,可以将left_indexright_index设置为True。
  5. validate参数可以用来检查合并的逻辑是否正确,确保数据的一致性。
相关推荐
彧azz1 小时前
图的存储结构详解:邻接矩阵的原理、实现与应用
开发语言·数据结构·学习·php
平头哥AI1 小时前
Day 22 _ 包装错误别丢链_%w、errors.Is 与 errors.As
android·服务器·学习·golang·go
一阵寒风2 小时前
CAM智能化助力PCB 智能制造-培训体系第六章.项目开发学习
学习·制造
传奇开心果编程2 小时前
【Xilem 0.4 基础语法学与练】第15课:状态管理与 memoize 性能优化
学习·rust·前端框架
具身AGI2 小时前
视频即仿真,物理AI 人类学习路线 的下一步
人工智能·学习
2601_962300813 小时前
机器学习贴士:使用Python编写MapReduce
hadoop·python·机器学习·mapreduce·数据处理
xyz_CDragon3 小时前
GitHub上4个爆款AI开源Skill:拍照后不用P图,用Codex一键生成高级海报(附效果图+使用教程)
人工智能·python·github·codex·skill
wuyk5553 小时前
从零吃透 MQTT 通信|第 8 章 FreeRTOS 多任务架构下 MQTT 工程架构,任务拆分、队列解耦、临界区保护
c语言·开发语言·stm32·学习·架构
weixin199701080163 小时前
[特殊字符]《跨境二手ERP对接Back Market:标准化API + 7~10工作日技术合规审核实录》(附Python源码)
开发语言·python·pandas
陈年老古董4 小时前
PyTorch食物图像分类实战:从数据集制作到CNN模型训练全流程详解
pytorch·深度学习·学习·机器学习·分类·cnn