草庐IT

python - Pandas 中的聚合

coder 2023-08-17 原文

  • 如何使用 Pandas 执行聚合?
  • 聚合后没有 DataFrame!发生了什么?
  • 如何主要聚合字符串列(到 list s, tuple s, strings with separator )?
  • 如何汇总计数?
  • 如何创建由聚合值填充的新列?

  • 我已经看到这些反复出现的问题询问 Pandas 聚合功能的各个方面。
    今天关于聚合及其各种用例的大部分信息都分散在数十个措辞恶劣、无法搜索的帖子中。
    这里的目的是为后代整理一些更重要的观点。
    本问答是一系列有用的用户指南的下一部分:
  • How to pivot a dataframe ,
  • Pandas concat
  • How do I operate on a DataFrame with a Series for every column?
  • Pandas Merging 101

  • 请注意,这篇文章并不能替代 documentation about aggregation和关于 groupby ,所以也请阅读!

    最佳答案

    问题 1
    如何使用 Pandas 执行聚合?
    展开 aggregation documentation .
    聚合函数是减少返回对象维度的函数。这意味着输出 Series/DataFrame 与原始行有更少或相同的行。
    下表列出了一些常见的聚合函数:

    Function    Description
    mean()         Compute mean of groups
    sum()         Compute sum of group values
    size()         Compute group sizes
    count()     Compute count of group
    std()         Standard deviation of groups
    var()         Compute variance of groups
    sem()         Standard error of the mean of groups
    describe()     Generates descriptive statistics
    first()     Compute first of group values
    last()         Compute last of group values
    nth()         Take nth value, or a subset if n is a list
    min()         Compute min of group values
    max()         Compute max of group values
    
    np.random.seed(123)
    
    df = pd.DataFrame({'A' : ['foo', 'foo', 'bar', 'foo', 'bar', 'foo'],
                       'B' : ['one', 'two', 'three','two', 'two', 'one'],
                       'C' : np.random.randint(5, size=6),
                       'D' : np.random.randint(5, size=6),
                       'E' : np.random.randint(5, size=6)})
    print (df)
         A      B  C  D  E
    0  foo    one  2  3  0
    1  foo    two  4  1  0
    2  bar  three  2  1  1
    3  foo    two  1  0  3
    4  bar    two  3  1  4
    5  foo    one  2  1  0
    
    按过滤列和 Cython implemented functions 聚合:
    df1 = df.groupby(['A', 'B'], as_index=False)['C'].sum()
    print (df1)
         A      B  C
    0  bar  three  2
    1  bar    two  3
    2  foo    one  4
    3  foo    two  5
    
    聚合函数用于所有列,但未在 groupby 中指定。函数,这里是 A, B列:
    df2 = df.groupby(['A', 'B'], as_index=False).sum()
    print (df2)
         A      B  C  D  E
    0  bar  three  2  1  1
    1  bar    two  3  1  4
    2  foo    one  4  4  0
    3  foo    two  5  1  3
    
    您还可以在 groupby 之后仅指定列表中用于聚合的某些列。功能:
    df3 = df.groupby(['A', 'B'], as_index=False)['C','D'].sum()
    print (df3)
         A      B  C  D
    0  bar  three  2  1
    1  bar    two  3  1
    2  foo    one  4  4
    3  foo    two  5  1
    
    使用函数 DataFrameGroupBy.agg 的结果相同:
    df1 = df.groupby(['A', 'B'], as_index=False)['C'].agg('sum')
    print (df1)
         A      B  C
    0  bar  three  2
    1  bar    two  3
    2  foo    one  4
    3  foo    two  5
    
    df2 = df.groupby(['A', 'B'], as_index=False).agg('sum')
    print (df2)
         A      B  C  D  E
    0  bar  three  2  1  1
    1  bar    two  3  1  4
    2  foo    one  4  4  0
    3  foo    two  5  1  3
    
    对于应用于一列的多个函数,请使用 tuple 的列表s - 新列和聚合函数的名称:
    df4 = (df.groupby(['A', 'B'])['C']
             .agg([('average','mean'),('total','sum')])
             .reset_index())
    print (df4)
         A      B  average  total
    0  bar  three      2.0      2
    1  bar    two      3.0      3
    2  foo    one      2.0      4
    3  foo    two      2.5      5
    
    如果想传递多个函数是可能的传递listtuple s:
    df5 = (df.groupby(['A', 'B'])
             .agg([('average','mean'),('total','sum')]))
    
    print (df5)
                    C             D             E
              average total average total average total
    A   B
    bar three     2.0     2     1.0     1     1.0     1
        two       3.0     3     1.0     1     4.0     4
    foo one       2.0     4     2.0     4     0.0     0
        two       2.5     5     0.5     1     1.5     3
    
    然后得到MultiIndex在列中:
    print (df5.columns)
    MultiIndex(levels=[['C', 'D', 'E'], ['average', 'total']],
               labels=[[0, 0, 1, 1, 2, 2], [0, 1, 0, 1, 0, 1]])
    
    并用于转换为列,展平 MultiIndex使用 mapjoin :
    df5.columns = df5.columns.map('_'.join)
    df5 = df5.reset_index()
    print (df5)
         A      B  C_average  C_total  D_average  D_total  E_average  E_total
    0  bar  three        2.0        2        1.0        1        1.0        1
    1  bar    two        3.0        3        1.0        1        4.0        4
    2  foo    one        2.0        4        2.0        4        0.0        0
    3  foo    two        2.5        5        0.5        1        1.5        3
    
    另一种解决方案是传递聚合函数列表,然后展平 MultiIndex对于其他列名称使用 str.replace :
    df5 = df.groupby(['A', 'B']).agg(['mean','sum'])
    
    df5.columns = (df5.columns.map('_'.join)
                      .str.replace('sum','total')
                      .str.replace('mean','average'))
    df5 = df5.reset_index()
    print (df5)
         A      B  C_average  C_total  D_average  D_total  E_average  E_total
    0  bar  three        2.0        2        1.0        1        1.0        1
    1  bar    two        3.0        3        1.0        1        4.0        4
    2  foo    one        2.0        4        2.0        4        0.0        0
    3  foo    two        2.5        5        0.5        1        1.5        3
    
    如果想分别用聚合函数指定每一列,传递 dictionary :
    df6 = (df.groupby(['A', 'B'], as_index=False)
             .agg({'C':'sum','D':'mean'})
             .rename(columns={'C':'C_total', 'D':'D_average'}))
    print (df6)
         A      B  C_total  D_average
    0  bar  three        2        1.0
    1  bar    two        3        1.0
    2  foo    one        4        2.0
    3  foo    two        5        0.5
    
    您也可以传递自定义函数:
    def func(x):
        return x.iat[0] + x.iat[-1]
    
    df7 = (df.groupby(['A', 'B'], as_index=False)
             .agg({'C':'sum','D': func})
             .rename(columns={'C':'C_total', 'D':'D_sum_first_and_last'}))
    print (df7)
         A      B  C_total  D_sum_first_and_last
    0  bar  three        2                     2
    1  bar    two        3                     2
    2  foo    one        4                     4
    3  foo    two        5                     1
    
    问题2
    聚合后没有 DataFrame!发生了什么?
    按两列或多列聚合:
    df1 = df.groupby(['A', 'B'])['C'].sum()
    print (df1)
    A    B
    bar  three    2
         two      3
    foo  one      4
         two      5
    Name: C, dtype: int32
    
    先查Indextype Pandas 对象的:
    print (df1.index)
    MultiIndex(levels=[['bar', 'foo'], ['one', 'three', 'two']],
               labels=[[0, 0, 1, 1], [1, 2, 0, 2]],
               names=['A', 'B'])
    
    print (type(df1))
    <class 'pandas.core.series.Series'>
    
    获取方式有两种解决方案MultiIndex Series列:
  • 添加参数 as_index=False
  • df1 = df.groupby(['A', 'B'], as_index=False)['C'].sum()
    print (df1)
         A      B  C
    0  bar  three  2
    1  bar    two  3
    2  foo    one  4
    3  foo    two  5
    
  • 使用 Series.reset_index :
  • df1 = df.groupby(['A', 'B'])['C'].sum().reset_index()
    print (df1)
         A      B  C
    0  bar  three  2
    1  bar    two  3
    2  foo    one  4
    3  foo    two  5
    

    如果按一列分组:
    df2 = df.groupby('A')['C'].sum()
    print (df2)
    A
    bar    5
    foo    9
    Name: C, dtype: int32
    
    ... 得到 SeriesIndex :
    print (df2.index)
    Index(['bar', 'foo'], dtype='object', name='A')
    
    print (type(df2))
    <class 'pandas.core.series.Series'>
    
    解决方案与 MultiIndex Series 中的解决方案相同:
    df2 = df.groupby('A', as_index=False)['C'].sum()
    print (df2)
         A  C
    0  bar  5
    1  foo  9
    
    df2 = df.groupby('A')['C'].sum().reset_index()
    print (df2)
         A  C
    0  bar  5
    1  foo  9
    
    问题 3
    如何主要聚合字符串列(到 list s, tuple s, strings with separator )?
    df = pd.DataFrame({'A' : ['a', 'c', 'b', 'b', 'a', 'c', 'b'],
                       'B' : ['one', 'two', 'three','two', 'two', 'one', 'three'],
                       'C' : ['three', 'one', 'two', 'two', 'three','two', 'one'],
                       'D' : [1,2,3,2,3,1,2]})
    print (df)
       A      B      C  D
    0  a    one  three  1
    1  c    two    one  2
    2  b  three    two  3
    3  b    two    two  2
    4  a    two  three  3
    5  c    one    two  1
    6  b  three    one  2
    
    可以通过 list 代替聚合函数, tuple , set用于转换列:
    df1 = df.groupby('A')['B'].agg(list).reset_index()
    print (df1)
       A                    B
    0  a           [one, two]
    1  b  [three, two, three]
    2  c           [two, one]
    
    另一种方法是使用 GroupBy.apply :
    df1 = df.groupby('A')['B'].apply(list).reset_index()
    print (df1)
       A                    B
    0  a           [one, two]
    1  b  [three, two, three]
    2  c           [two, one]
    
    要转换为带分隔符的字符串,请使用 .join仅当它是字符串列时:
    df2 = df.groupby('A')['B'].agg(','.join).reset_index()
    print (df2)
       A                B
    0  a          one,two
    1  b  three,two,three
    2  c          two,one
    
    如果是数字列,请使用带有 astype 的 lambda 函数用于转换为 string s:
    df3 = (df.groupby('A')['D']
             .agg(lambda x: ','.join(x.astype(str)))
             .reset_index())
    print (df3)
       A      D
    0  a    1,3
    1  b  3,2,2
    2  c    2,1
    
    另一种解决方案是在 groupby 之前转换为字符串:
    df3 = (df.assign(D = df['D'].astype(str))
             .groupby('A')['D']
             .agg(','.join).reset_index())
    print (df3)
       A      D
    0  a    1,3
    1  b  3,2,2
    2  c    2,1
    
    要转换所有列,请不要在 groupby 之后传递列列表.
    没有任何栏目 D , 因为 automatic exclusion of 'nuisance' columns .这意味着排除所有数字列。
    df4 = df.groupby('A').agg(','.join).reset_index()
    print (df4)
       A                B            C
    0  a          one,two  three,three
    1  b  three,two,three  two,two,one
    2  c          two,one      one,two
    
    所以需要把所有的列都转换成字符串,然后得到所有的列:
    df5 = (df.groupby('A')
             .agg(lambda x: ','.join(x.astype(str)))
             .reset_index())
    print (df5)
       A                B            C      D
    0  a          one,two  three,three    1,3
    1  b  three,two,three  two,two,one  3,2,2
    2  c          two,one      one,two    2,1
    
    问题 4
    如何汇总计数?
    df = pd.DataFrame({'A' : ['a', 'c', 'b', 'b', 'a', 'c', 'b'],
                       'B' : ['one', 'two', 'three','two', 'two', 'one', 'three'],
                       'C' : ['three', np.nan, np.nan, 'two', 'three','two', 'one'],
                       'D' : [np.nan,2,3,2,3,np.nan,2]})
    print (df)
       A      B      C    D
    0  a    one  three  NaN
    1  c    two    NaN  2.0
    2  b  three    NaN  3.0
    3  b    two    two  2.0
    4  a    two  three  3.0
    5  c    one    two  NaN
    6  b  three    one  2.0
    
    功能 GroupBy.size size每组:
    df1 = df.groupby('A').size().reset_index(name='COUNT')
    print (df1)
       A  COUNT
    0  a      2
    1  b      3
    2  c      2
    
    功能 GroupBy.count 排除缺失值:
    df2 = df.groupby('A')['C'].count().reset_index(name='COUNT')
    print (df2)
       A  COUNT
    0  a      2
    1  b      2
    2  c      1
    
    此函数应用于多列以计算非缺失值:
    df3 = df.groupby('A').count().add_suffix('_COUNT').reset_index()
    print (df3)
       A  B_COUNT  C_COUNT  D_COUNT
    0  a        2        2        1
    1  b        3        2        3
    2  c        2        1        1
    
    一个相关的函数是 Series.value_counts .它以降序返回包含唯一值计数的对象的大小,因此第一个元素是最常出现的元素。它不包括 NaN s 值默认。
    df4 = (df['A'].value_counts()
                  .rename_axis('A')
                  .reset_index(name='COUNT'))
    print (df4)
       A  COUNT
    0  b      3
    1  a      2
    2  c      2
    
    如果您想要与使用函数 groupby 相同的输出+ size , 添加 Series.sort_index :
    df5 = (df['A'].value_counts()
                  .sort_index()
                  .rename_axis('A')
                  .reset_index(name='COUNT'))
    print (df5)
       A  COUNT
    0  a      2
    1  b      3
    2  c      2
    
    问题 5
    如何创建由聚合值填充的新列?
    方法 GroupBy.transform 返回与被分组的对象索引相同(相同大小)的对象。
    the Pandas documentation想要查询更多的信息。
    np.random.seed(123)
    
    df = pd.DataFrame({'A' : ['foo', 'foo', 'bar', 'foo', 'bar', 'foo'],
                        'B' : ['one', 'two', 'three','two', 'two', 'one'],
                        'C' : np.random.randint(5, size=6),
                        'D' : np.random.randint(5, size=6)})
    print (df)
         A      B  C  D
    0  foo    one  2  3
    1  foo    two  4  1
    2  bar  three  2  1
    3  foo    two  1  0
    4  bar    two  3  1
    5  foo    one  2  1
    
    
    df['C1'] = df.groupby('A')['C'].transform('sum')
    df['C2'] = df.groupby(['A','B'])['C'].transform('sum')
    
    
    df[['C3','D3']] = df.groupby('A')['C','D'].transform('sum')
    df[['C4','D4']] = df.groupby(['A','B'])['C','D'].transform('sum')
    
    print (df)
    
         A      B  C  D  C1  C2  C3  D3  C4  D4
    0  foo    one  2  3   9   4   9   5   4   4
    1  foo    two  4  1   9   5   9   5   5   1
    2  bar  three  2  1   5   2   5   2   2   1
    3  foo    two  1  0   9   5   9   5   5   1
    4  bar    two  3  1   5   3   5   2   3   1
    5  foo    one  2  1   9   4   9   5   4   4
    

    关于python - Pandas 中的聚合,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/53781634/

    有关python - Pandas 中的聚合的更多相关文章

    1. ruby - 如何从 ruby​​ 中的字符串运行任意对象方法? - 2

      总的来说,我对ruby​​还比较陌生,我正在为我正在创建的对象编写一些rspec测试用例。许多测试用例都非常基础,我只是想确保正确填充和返回值。我想知道是否有办法使用循环结构来执行此操作。不必为我要测试的每个方法都设置一个assertEquals。例如:describeitem,"TestingtheItem"doit"willhaveanullvaluetostart"doitem=Item.new#HereIcoulddotheitem.name.shouldbe_nil#thenIcoulddoitem.category.shouldbe_nilendend但我想要一些方法来使用

    2. ruby - 其他文件中的 Rake 任务 - 2

      我试图在一个项目中使用rake,如果我把所有东西都放到Rakefile中,它会很大并且很难读取/找到东西,所以我试着将每个命名空间放在lib/rake中它自己的文件中,我添加了这个到我的rake文件的顶部:Dir['#{File.dirname(__FILE__)}/lib/rake/*.rake'].map{|f|requiref}它加载文件没问题,但没有任务。我现在只有一个.rake文件作为测试,名为“servers.rake”,它看起来像这样:namespace:serverdotask:testdoputs"test"endend所以当我运行rakeserver:testid时

    3. ruby-on-rails - Ruby net/ldap 模块中的内存泄漏 - 2

      作为我的Rails应用程序的一部分,我编写了一个小导入程序,它从我们的LDAP系统中吸取数据并将其塞入一个用户表中。不幸的是,与LDAP相关的代码在遍历我们的32K用户时泄漏了大量内存,我一直无法弄清楚如何解决这个问题。这个问题似乎在某种程度上与LDAP库有关,因为当我删除对LDAP内容的调用时,内存使用情况会很好地稳定下来。此外,不断增加的对象是Net::BER::BerIdentifiedString和Net::BER::BerIdentifiedArray,它们都是LDAP库的一部分。当我运行导入时,内存使用量最终达到超过1GB的峰值。如果问题存在,我需要找到一些方法来更正我的代

    4. python - 如何使用 Ruby 或 Python 创建一系列高音调和低音调的蜂鸣声? - 2

      关闭。这个问题是opinion-based.它目前不接受答案。想要改进这个问题?更新问题,以便editingthispost可以用事实和引用来回答它.关闭4年前。Improvethisquestion我想在固定时间创建一系列低音和高音调的哔哔声。例如:在150毫秒时发出高音调的蜂鸣声在151毫秒时发出低音调的蜂鸣声200毫秒时发出低音调的蜂鸣声250毫秒的高音调蜂鸣声有没有办法在Ruby或Python中做到这一点?我真的不在乎输出编码是什么(.wav、.mp3、.ogg等等),但我确实想创建一个输出文件。

    5. ruby-on-rails - Rails 3 中的多个路由文件 - 2

      Rails2.3可以选择随时使用RouteSet#add_configuration_file添加更多路由。是否可以在Rails3项目中做同样的事情? 最佳答案 在config/application.rb中:config.paths.config.routes在Rails3.2(也可能是Rails3.1)中,使用:config.paths["config/routes"] 关于ruby-on-rails-Rails3中的多个路由文件,我们在StackOverflow上找到一个类似的问题

    6. ruby-on-rails - Rails - 一个 View 中的多个模型 - 2

      我需要从一个View访问多个模型。以前,我的links_controller仅用于提供以不同方式排序的链接资源。现在我想包括一个部分(我假设)显示按分数排序的顶级用户(@users=User.all.sort_by(&:score))我知道我可以将此代码插入每个链接操作并从View访问它,但这似乎不是“ruby方式”,我将需要在不久的将来访问更多模型。这可能会变得很脏,是否有针对这种情况的任何技术?注意事项:我认为我的应用程序正朝着单一格式和动态页面内容的方向发展,本质上是一个典型的网络应用程序。我知道before_filter但考虑到我希望应用程序进入的方向,这似乎很麻烦。最终从任何

    7. ruby-on-rails - Rails 3.2.1 中 ActionMailer 中的未定义方法 'default_content_type=' - 2

      我在我的项目中添加了一个系统来重置用户密码并通过电子邮件将密码发送给他,以防他忘记密码。昨天它运行良好(当我实现它时)。当我今天尝试启动服务器时,出现以下错误。=>BootingWEBrick=>Rails3.2.1applicationstartingindevelopmentonhttp://0.0.0.0:3000=>Callwith-dtodetach=>Ctrl-CtoshutdownserverExiting/Users/vinayshenoy/.rvm/gems/ruby-1.9.3-p0/gems/actionmailer-3.2.1/lib/action_mailer

    8. ruby-on-rails - Rails 应用程序中的 Rails : How are you using application_controller. rb 是新手吗? - 2

      刚入门rails,开始慢慢理解。有人可以解释或给我一些关于在application_controller中编码的好处或时间和原因的想法吗?有哪些用例。您如何为Rails应用程序使用应用程序Controller?我不想在那里放太多代码,因为据我了解,每个请求都会调用此Controller。这是真的? 最佳答案 ApplicationController实际上是您应用程序中的每个其他Controller都将从中继承的类(尽管这不是强制性的)。我同意不要用太多代码弄乱它并保持干净整洁的态度,尽管在某些情况下ApplicationContr

    9. ruby-on-rails - form_for 中不在模型中的自定义字段 - 2

      我想向我的Controller传递一个参数,它是一个简单的复选框,但我不知道如何在模型的form_for中引入它,这是我的观点:{:id=>'go_finance'}do|f|%>Transferirde:para:Entrada:"input",:placeholder=>"Quantofoiganho?"%>Saída:"output",:placeholder=>"Quantofoigasto?"%>Nota:我想做一个额外的复选框,但我该怎么做,模型中没有一个对象,而是一个要检查的对象,以便在Controller中创建一个ifelse,如果没有检查,请帮助我,非常感谢,谢谢

    10. ruby - rspec 需要 .rspec 文件中的 spec_helper - 2

      我注意到像bundler这样的项目在每个specfile中执行requirespec_helper我还注意到rspec使用选项--require,它允许您在引导rspec时要求一个文件。您还可以将其添加到.rspec文件中,因此只要您运行不带参数的rspec就会添加它。使用上述方法有什么缺点可以解释为什么像bundler这样的项目选择在每个规范文件中都需要spec_helper吗? 最佳答案 我不在Bundler上工作,所以我不能直接谈论他们的做法。并非所有项目都checkin.rspec文件。原因是这个文件,通常按照当前的惯例,只

    随机推荐