[Python3]pandas.merge用法详解

全栈程序员-用户IM • 2022年5月31日上午6:46 • 未分类

大家好，又见面了，我是你们的朋友全栈君。

摘要

数据分析与建模的时候大部分时间在数据准备上，包括对数据的加载、清理、转换以及重塑。pandas提供了一组高级的、灵活的、高效的核心函数，能够轻松的将数据规整化。这节主要对pandas合并数据集的merge函数进行详解。(用过SQL或其他关系型数据库的可能会对这个方法比较熟悉。)码字不易，喜欢请点赞！！！

1.merge函数的参数一览表

[Python3]pandas.merge用法详解

2.创建两个DataFrame
在这里插入图片描述

3.pd.merge()方法设置连接字段。
默认参数how是inner内连接，并且会按照相同的字段key进行合并，即等价于on=‘key’。
在这里插入图片描述

也可以显示的设置on=‘key’，这里也推荐这么做。
在这里插入图片描述

当两边合并字段不同时，可以使用left_on和right_on参数设置合并字段。当然这里合并字段都是key所以left_on和right_on参数值都是key。
在这里插入图片描述

4.pd.merge()方法设置连接方法。
主要包括inner（内连接）、outer（外链接）、left（左连接）、right（右连接）。
参数how默认值是inner内连接，上面的都是采用内连接，连接两边都有的值。
当采用outer外连接时，会取并集，并用NaN填充。

外连接其实左连接和右连接的并集。左连接是左侧DataFrame取全部数据，右侧DataFrame匹配左侧DataFrame。（右连接right和左连接类似）
在这里插入图片描述