pandas库的pd.merge函数

pandas库的pd.merge函数

pd.merge(left, right, how='inner', on=None, left_on=None, right_on=None,

         left_index=False, right_index=False, sort=True,

         suffixes=('_x', '_y'), copy=True, indicator=False,

         validate=None)

参数如下:

left: 拼接的左侧DataFrame对象

right: 拼接的右侧DataFrame对象

on: 要加入的列或索引级别名称。 必须在左侧和右侧DataFrame对象中找到。 如果未传递且left_index和right_index为False,则DataFrame中的列的交集将被推断为连接键。

left_on:左侧DataFrame中的列或索引级别用作键。 可以是列名,索引级名称,也可以是长度等于DataFrame长度的数组。

right_on: 左侧DataFrame中的列或索引级别用作键。 可以是列名,索引级名称,也可以是长度等于DataFrame长度的数组。

left_index: 如果为True,则使用左侧DataFrame中的索引(行标签)作为其连接键。 对于具有MultiIndex(分层)的DataFrame,级别数必须与右侧DataFrame中的连接键数相匹配。

right_index: 与left_index功能相似。

how: One of ‘left’, ‘right’, ‘outer’, ‘inner’. 默认inner。inner是取交集,outer取并集。比如left:[‘A’,‘B’,‘C’];right[’'A,‘C’,‘D’];inner取交集的话,left中出现的A会和right中出现的买一个A进行匹配拼接,如果没有是B,在right中没有匹配到,则会丢失。'outer’取并集,出现的A会进行一一匹配,没有同时出现的会将缺失的部分添加缺失值。

sort: 按字典顺序通过连接键对结果DataFrame进行排序。 默认为True,设置为False将在很多情况下显着提高性能。

suffixes: 用于重叠列的字符串后缀元组。 默认为(‘x’,’ y’)。

copy: 始终从传递的DataFrame对象复制数据(默认为True),即使不需要重建索引也是如此。

indicator:将一列添加到名为_merge的输出DataFrame,其中包含有关每行源的信息。 _merge是分类类型,并且对于其合并键仅出现在“左”DataFrame中的观察值,取得值为left_only,对于其合并键仅出现在“右”DataFrame中的观察值为right_only,并且如果在两者中都找到观察点的合并键,则为left_only。

1、基础实例:

dic_left = {'地市': ['廊坊', '张家口', '承德'], '字段a': [1, 2, 3],
      
'字段b': [11, 12, 13]}
left = pd.DataFrame(dic_left)
dic_right = {
'地市': ['廊坊', '张家口', '承德'], '字段c': [22, 24, 26],
           
'字段d': [88, 99, 77]}
right = pd.DataFrame(dic_right)

print(left)
print(right)
result = pd.merge(left, right,
on='地市')
print(result)

# on参数传递的key作为连接键

输出:

2、传入的on的参数是列表:

dic_left = {'地市': ['廊坊', '张家口', '承德'], '区号': ['0316', '0317', '0313'], '字段a': [1, 2, 3],
      
'字段b': [11, 12, 13]}
left = pd.DataFrame(dic_left)
dic_right = {
'地市': ['廊坊', '张家口', '承德'], '区号': ['0316', '0317', '0313'],'字段c': [22, 24, 26],
           
'字段d': [88, 99, 77]}
right = pd.DataFrame(dic_right)

print(left)
print(right)
result = pd.merge(left, right,
on=['地市','区号'])
print(result)

输出:

3、Merge method

如果组合键没有出现在左表或右表中,则连接表中的值将为NA。

Merge method        SQL Join Name        Description

left   LEFTOUTER JOIN     Use keys from left frame only

right RIGHT OUTER JOIN Use keys from right frame only

outer        FULL OUTER JOIN   Use union of keys from both frames

inner        INNER JOIN     Use intersection of keys from both frames

dic_left = {'地市': ['廊坊', '张家口', '承德','邯郸'], '区号': ['0316', '0317', '0313','0314'], '字段a': [1, 2, 3,4],
      
'字段b': [11, 12, 13,14]}
left = pd.DataFrame(dic_left)
dic_right = {
'地市': ['廊坊', '张家口', '承德'], '区号': ['0316', '0317', '0313'],'字段c': [22, 24, 26],
           
'字段d': [88, 99, 77]}
right = pd.DataFrame(dic_right)

print(left)
print(right)
result = pd.merge(left, right,
how='left', on=['地市','区号'])
print(result)

输出:

result = pd.merge(left, right, how='right', on=['地市','区号'])
print(result)

输出:

dic_left = {'地市': ['廊坊', '张家口', '承德','邯郸'], '区号': ['0316', '0317', '0313','0314'], '字段a': [1, 2, 3,4],
       
'字段b': [11, 12, 13,14]}
 left = pd.DataFrame(dic_left)
 dic_right = {
'地市': ['廊坊', '张家口', '承德','雄安'], '区号': ['0316', '0317', '0313','0319'],'字段c': [22, 24, 26,28],
            
'字段d': [88, 99, 77,66]}
 right = pd.DataFrame(dic_right)
 
print(left)
 
print(right)
result = pd.merge(left, right,
how='outer', on=['地市','区号'])
 
print(result)

输出:

4、传入indicator参数

merge接受参数指示符。 如果为True,则将名为_merge的Categorical类型列添加到具有值的输出对象:

Observation Origin _merge value

Merge key only in ‘left’ frame left_only

Merge key only in ‘right’ frame      right_only

Merge key in   both frames

result = pd.merge(left, right, how='outer', on=['地市','区号'], indicator=True)
print(result)

输出:

指标参数也将接受字符串参数,在这种情况下,指标函数将使用传递的字符串的值作为指标列的名称。

result = pd.merge(left, right, how='outer', on=['地市','区号'],indicator='indicator_column')
print(result)

输出:

5、以index为链接键

需要同时设置left_index= True 和 right_index= True,或者left_index设置的同时,right_on指定某个Key。总的来说就是需要指定left、right链接的键,可以同时是key、index或者混合使用。

dic_left = {'地市': ['廊坊', '张家口', '承德', '邯郸'], '区号': ['0316', '0317', '0313', '0314'],
           
'字段a': [1, 2, 3, 4],
           
'字段b': [11, 12, 13, 14]}
left = pd.DataFrame(dic_left,
index=['廊坊', '张家口', '承德', '邯郸'])
dic_right = {
'地市': ['廊坊', '张家口', '承德', '雄安'], '区号': ['0316', '0317', '0313', '0319'],
            
'字段c': [22, 24, 26, 28],
            
'字段d': [88, 99, 77, 66]}
right = pd.DataFrame(dic_right,
index=['廊坊', '张家口', '承德', '雄安'])
print(left)
print(right)
result = pd.merge(left, right,
how='inner', left_index=True, right_index=True)
print(result)

输出:

result = pd.merge(left, right, left_on='地市', right_index=True, how='left', sort=False)
print(result)

输出:

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值