我有两段代码似乎做同样的事情,但其中一段比另一段快将近一千倍。
这是第一部分:
t1 = time.time()
df[new_col] = np.where(df[col] < j, val_1, val_2)
t2 = time.time()
ts.append(t2 - t1)
在 ts 我有这样的值:
0.0007321834564208984, 0.0002918243408203125, 0.0002799034118652344
相比之下,这部分代码:
t1 = time.time()
df['new_col'] = np.where((df[col] >= i1) & (df[col] < i2), val, df.new_col)
t2 = time.time()
ts.append(t2 - t1)
创建 ts 并填充如下值:
0.11008906364440918, 0.09556794166564941, 0.08580684661865234
我无法弄清楚第一个和第二个作业之间的本质区别是什么。
在这两种情况下,df 应该相同。
已添加
原来本质的区别不在我看的地方。在我拥有的代码的快速版本中:
df = inp_df.copy()
在类方法的开头(其中 inp_df 是该方法的输入数据框)。在慢速版本中,我直接在输入数据帧上进行操作。复制输入数据帧并对其进行操作后,速度变快了。
最佳答案
为 Pandas 系列赋值很便宜,尤其是当您通过 pd.Series、np.ndarray 或 list 等常规对象赋值时>.
备注broadcasting非常便宜,即当您在第一个示例中设置标量值时,例如 val_1 和 val_2。
您的第二个示例针对不满足您的条件的情况进行了系列分配。这是相对昂贵的。
另一方面,您执行的计算相对昂贵。
在第一个示例中,您有一个计算:
df[col] < j
在第二个例子中,你至少有三个计算:
a = df[col] >= i1
b = df[col] < i2
a & b
因此,您可以而且应该预期第二个版本会更贵。
timeit最好使用 timeit 模块来实现可靠的性能计时。下面的可重现示例显示了比您声称的更小的性能差异:
import pandas as pd, numpy as np
np.random.seed(0)
df = pd.DataFrame({'A': np.random.random(10**7)})
j = 0.5
i1, i2 = 0.25, 0.75
%timeit np.where(df['A'] < j, 1, 2) # 85.5 ms per loop
%timeit np.where((df['A'] >= i1) & (df['A'] < i2), 1, df['A']) # 161 ms per loop
一次计算比 3 次计算便宜:
%timeit df['A'] < j # 14.8 ms per loop
%timeit (df['A'] >= i1) & (df['A'] < i2) # 65.6 ms per loop
通过标量值进行广播比分配系列更便宜:
%timeit np.where(df['A'] < j, 1, df['A']) # 113 ms per loop
%timeit np.where((df['A'] >= i1) & (df['A'] < i2), 1, 2) # 146 ms per loop
关于python - 为什么在一种情况下 pandas 数据框的一列中的值变化快而在另一种情况下变化慢?,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/53632928/
类classAprivatedeffooputs:fooendpublicdefbarputs:barendprivatedefzimputs:zimendprotecteddefdibputs:dibendendA的实例a=A.new测试a.foorescueputs:faila.barrescueputs:faila.zimrescueputs:faila.dibrescueputs:faila.gazrescueputs:fail测试输出failbarfailfailfail.发送测试[:foo,:bar,:zim,:dib,:gaz].each{|m|a.send(m)resc
关闭。这个问题是opinion-based.它目前不接受答案。想要改进这个问题?更新问题,以便editingthispost可以用事实和引用来回答它.关闭4年前。Improvethisquestion我想在固定时间创建一系列低音和高音调的哔哔声。例如:在150毫秒时发出高音调的蜂鸣声在151毫秒时发出低音调的蜂鸣声200毫秒时发出低音调的蜂鸣声250毫秒的高音调蜂鸣声有没有办法在Ruby或Python中做到这一点?我真的不在乎输出编码是什么(.wav、.mp3、.ogg等等),但我确实想创建一个输出文件。
我有一个模型:classItem项目有一个属性“商店”基于存储的值,我希望Item对象对特定方法具有不同的行为。Rails中是否有针对此的通用设计模式?如果方法中没有大的if-else语句,这是如何干净利落地完成的? 最佳答案 通常通过Single-TableInheritance. 关于ruby-on-rails-Rails-子类化模型的设计模式是什么?,我们在StackOverflow上找到一个类似的问题: https://stackoverflow.co
我正在使用的第三方API的文档状态:"[O]urAPIonlyacceptspaddedBase64encodedstrings."什么是“填充的Base64编码字符串”以及如何在Ruby中生成它们。下面的代码是我第一次尝试创建转换为Base64的JSON格式数据。xa=Base64.encode64(a.to_json) 最佳答案 他们说的padding其实就是Base64本身的一部分。它是末尾的“=”和“==”。Base64将3个字节的数据包编码为4个编码字符。所以如果你的输入数据有长度n和n%3=1=>"=="末尾用于填充n%
我主要使用Ruby来执行此操作,但到目前为止我的攻击计划如下:使用gemsrdf、rdf-rdfa和rdf-microdata或mida来解析给定任何URI的数据。我认为最好映射到像schema.org这样的统一模式,例如使用这个yaml文件,它试图描述数据词汇表和opengraph到schema.org之间的转换:#SchemaXtoschema.orgconversion#data-vocabularyDV:name:namestreet-address:streetAddressregion:addressRegionlocality:addressLocalityphoto:i
为什么4.1%2返回0.0999999999999996?但是4.2%2==0.2。 最佳答案 参见此处:WhatEveryProgrammerShouldKnowAboutFloating-PointArithmetic实数是无限的。计算机使用的位数有限(今天是32位、64位)。因此计算机进行的浮点运算不能代表所有的实数。0.1是这些数字之一。请注意,这不是与Ruby相关的问题,而是与所有编程语言相关的问题,因为它来自计算机表示实数的方式。 关于ruby-为什么4.1%2使用Ruby返
这是在Ruby中设置默认值的常用方法:classQuietByDefaultdefinitialize(opts={})@verbose=opts[:verbose]endend这是一个容易落入的陷阱:classVerboseNoMatterWhatdefinitialize(opts={})@verbose=opts[:verbose]||trueendend正确的做法是:classVerboseByDefaultdefinitialize(opts={})@verbose=opts.include?(:verbose)?opts[:verbose]:trueendend编写Verb
它不等于主线程的binding,这个toplevel作用域是什么?此作用域与主线程中的binding有何不同?>ruby-e'putsTOPLEVEL_BINDING===binding'false 最佳答案 事实是,TOPLEVEL_BINDING始终引用Binding的预定义全局实例,而Kernel#binding创建的新实例>Binding每次封装当前执行上下文。在顶层,它们都包含相同的绑定(bind),但它们不是同一个对象,您无法使用==或===测试它们的绑定(bind)相等性。putsTOPLEVEL_BINDINGput
我想在一个没有Sass引擎的类中使用Sass颜色函数。我已经在项目中使用了sassgem,所以我认为搭载会像以下一样简单:classRectangleincludeSass::Script::FunctionsdefcolorSass::Script::Color.new([0x82,0x39,0x06])enddefrender#hamlengineexecutedwithcontextofself#sothatwithintemlateicouldcall#%stop{offset:'0%',stop:{color:lighten(color)}}endend更新:参见上面的#re
我可以得到Infinity和NaNn=9.0/0#=>Infinityn.class#=>Floatm=0/0.0#=>NaNm.class#=>Float但是当我想直接访问Infinity或NaN时:Infinity#=>uninitializedconstantInfinity(NameError)NaN#=>uninitializedconstantNaN(NameError)什么是Infinity和NaN?它们是对象、关键字还是其他东西? 最佳答案 您看到打印为Infinity和NaN的只是Float类的两个特殊实例的字符串