DATAFRAME_草庐IT

python - 使用已知列值更改 pandas DataFrame 多列中的值

假设我有一个这样的数据框:KnownvalueABCDEFGH17.34130000000033.453400000000我想做的是，当已知值在0-10之间时，A从0变为1。当已知值在10-20之间时，B从0变为1，依此类推。改完之后应该是这样的:KnownvalueABCDEFGH17.34130100000033.453400010000有人知道如何应用一种方法来改变它吗？最佳答案我首先将Knownvalue系列放入一个等于其截断值除以10的整数列表中(例如27.87//10=2)。这些桶表示所需列位置的整数。因为Known

多列已知 Knownvalue code section python pandas

python - 在另一列中查找具有相同值的行 - Python

我有一个基本的Python问题。我有一个像这样的Pandas数据框:ID|Name|User_id---+------+--------1John102Tom113Sam124Ben135Jen106Tim117Sean148Ana159Sam1210Ben13我想获取具有相同User_id值的名称和用户ID，而不返回出现两次的名称。所以我希望输出看起来像这样:JohnJen10TomTim11 最佳答案 IIUC你可以这样做，groupbyon'User_id'然后过滤groupby:In[54]:group=df.groupby

python section code User_id pandas group-by dataframe

python - Pandas 数据框中以相同字符串开头的列的总和值

我有一个包含大约100列的数据框，如下所示:IdEconomics-1English-107English-2History-3Economics-zzEconomics-2\05611010011100001026001001343000101414010010HistoEconomics-51Literature-reLiteratureu40101010001200003011041000我的目标是只保留全局类别——英语、历史、文学——并分别在此数据框中写入它们的组件值的总和。例如，“English”将是“English-107”和“English-2”的总和:IdEconomi

python Pandas code 39 section dataframe startswith

python - 来自数据框 Pandas 的数据的多线程

我正在努力使用多线程来计算购物篮中有不同购物项目的客户列表之间的相关性。所以我有一个包含1,000个客户的pandas数据框，这意味着我必须计算相关性100万次，这需要很长时间才能处理数据框的示例如下所示:IDItem1Banana1Apple2Orange2Banana2Tomato3Apple3Tomato3Orange这是代码的简化版本:importpandasaspddefrelatedness(customer1,customer2):#dosomecalculationstomeasuretherelationbetweenthecustomersdata=pd.read_

多线 python section customers customers_list multithreading dataframe bigdata

python - 如何对 pandas DataFrame 中的值进行二值化？

我有以下数据框:df=pd.DataFrame(['Male','Female','Female','Unknown','Male'],columns=['Gender'])我想将其转换为包含“男性”、“女性”和“未知”列的DataFrame，值0和1表示性别。GenderMaleFemaleMale10Female01....为此，我编写了一个函数并使用map调用该函数。defisValue(x,value):if(x==value):return1else:return0forvalueindf['Gender'].unique():df[str(value)]=df['Gende

DataFrame python 39 code section pandas scikit-learn

python - 无法访问数据框列

我正在从csv文件导入数据框，但无法按名称访问其中的某些列。怎么回事？更具体地说:>importpandas>jobNames=pandas.read_csv("job_names.csv")>print(jobNames)job_idjob_namenum_judgements0933985Foo1801933130Moo1752933123Goo1503933094Flue1204933088Tru120当我尝试访问第二列时，出现错误:>jobNames.job_nameAttributeError:'DataFrame'objecthasnoattribute'job_name'

python 无法 code section pre csv pandas dataframe removing-whitespace

python - 按两列分组并计算 Pandas 中每个组合的出现次数

我有以下数据框:data=pd.DataFrame({'user_id':['a1','a1','a1','a2','a2','a2','a3','a3','a3'],'product_id':['p1','p1','p2','p1','p1','p1','p2','p2','p3']})product_iduser_idp1a1p1a1p2a1p1a2p1a2p1a2p2a3p2a3p3a3在实际情况下可能还有其他一些列，但我需要做的是按数据框按product_id和user_id列分组并计算每个组合的数量并将其添加为新数据框中的新列输出应该是这样的:user_idproduct_i

python Pandas 39 product_id product dataframe data-analysis

python - Pandas ，通过列值的单调增加来拆分数据框

我有一个巨大的数据框，其中包含一个名为time的日期时间类型列和另一个名为dist的浮点型列，数据框已根据时间和dist进行排序。我想根据dist的单调递增将数据帧分成几个数据帧。拆分dtdist02016081111:101.012016081111:151.422016081112:151.832016081112:320.642016081112:340.852016081114:380.2进入dtdist02016081111:101.012016081111:151.422016081112:151.8dtdist02016081112:320.612016081112:34

加来单调 20160811 dist code python pandas numpy dataframe

python - 如何用python中DataFrame列的模式替换NA值？

我对Python(和本网站)完全陌生，目前正在尝试用它们的模式替换特定数据框列中的NA值。我尝试了各种无效的方法。请帮我找出我做错了什么:注意:我使用的所有列都是float64类型。我的所有代码都运行了，但是当我在列中使用df[cols_mode].isnull().sum()检查空值时，它保持不变。方法一:cols_mode=['race','goal','date','go_out','career_c']df[cols_mode].apply(lambdax:x.fillna(x.mode,inplace=True))我也尝试了Imputer方法，但遇到了同样的结果方法二:for

python 何用 39 code inplace dataframe

python - 返回索引元组和 .max() 值？

我正在尝试返回索引元组(下面的人名)和下面“%”列的最大值。当我创建一个Dataframe并尝试df['%'].max()Pandas总是只返回值而不是索引。但是，我想从“%”列中的索引和最大值的键值对创建一个元组。我确定这是一个新手问题，谢谢你帮助我!这是一些示例数据:Points_ScoredPossible_Points%FavoriateFoodJan602000.3PuddingJane872000.435PizzaBob542000.27SaladBubba422000.21SalsaJack982000.49AvacodoJohn452000.225BaconMike63

python max section 200 code python-3.x pandas dataframe tuples