【笔记】效率之门——Python中的函数式编程技巧

清风莫追 2023-04-17 原文

文章目录

Python函数式编程

Python函数式编程

我的AI Studio项目：【笔记】LearnDL第三课：Python高级编程——抽象与封装 - 飞桨AI Studio (baidu.com)

python中函数式编程的一些技巧，可以提升我们编写代码的效率，写出更加清晰且高效的代码。

开发者关心两个效率，

程序运行的效率：程序用更少的计算资源完成更多的任务。
编写代码的效率：程序员在更少的时间实现更多的功能。

随着计算机算力的不断增长，如今我们更加关心的往往是后者。

本文主要包含以下内容：

函数应当如何使用数据
使用列表推导式或字典推导式简化代码
使用Lambda函数，简化代码
python中一些内置函数的使用技巧
什么是高阶函数
使用函数式编程的技巧完成一个小任务

最后一节“函数式编程的应用”中用到了一个图像数据集，在AI Studio中可以使用它。

1. 数据

数据的状态——尤为重要
- 不修改外部环境，不影响输入，多次调用函数不会产生不同的结果
避免可变的状态
- 尽量使用不可变的数据结构。例如list可变，而tuple不可变。

# 返回斐波那契数列的某一项
def fib(i):
    if i > 1:
        return fib(i - 1) + fib(i - 2)
    else:
        return 1
print(fib(5))

使用可变的数据结构，例如list，有时会踩坑，例如作为函数的默认参数时，下面是一个例子。

你惊讶地发现，put(10)和put(5)竟然输出了一样的结果，而你单独运行put(5)时又能得到正确的结果。

def put(n, x=[1, 1]):
    while len(x) < n:
        x.append(x[-1] + x[-2])
    return x

print(put(10))
print(put(5))

[1, 1, 2, 3, 5, 8, 13, 21, 34, 55]
[1, 1, 2, 3, 5, 8, 13, 21, 34, 55]

原因就是，两次调用put函数时，默认参数[1, 1]都是同一个对象，例如可以打印出对象的id（相当于在内存中的地址）看一下，发现两次调用put函数都在直接操作同一个list对象。

def put(n, x=[1, 1]):
    print(id(x))
    while len(x) < n:
        x.append(x[-1] + x[-2])
    return x
put(10), put(5)

140357520173648
140357520173648
([1, 1, 2, 3, 5, 8, 13, 21, 34, 55], [1, 1, 2, 3, 5, 8, 13, 21, 34, 55])

而使用不可变的数据对象作为函数的默认参数，就不会出现该问题。之前因为默认参数list本身也是一个对象实例，“可变”就是可以被篡改；而元组对象本身是无法修改的，后面代码怎么写都不会影响默认参数的值。

下面的例子中，你发现两次调用时元组x的id还是相同的，但是转换成的list的id就不同了，put(5)也得到了正确的结果。

def put(n, x=(1, 1)):
    print("tuple:", id(x))
    x = list(x)
    print("list: ", id(x))
    while len(x) < n:
        x.append(x[-1] + x[-2])
    return x
put(10), put(5)

tuple: 140357563320112
list:  140357519739872
tuple: 140357563320112
list:  140357519346416
([1, 1, 2, 3, 5, 8, 13, 21, 34, 55], [1, 1, 2, 3, 5])

2. 推导式

列表推导式与字典推导式，可以提升我们编码的效率，以及程序运行的效率。

例如前面的put函数，使用推导式，函数体仅需一行代码，而且代码逻辑也清晰易懂。

# 列表推导式
def put(n):
    return [fib(i) for i in range(n)]
print(put(5))

# 字典推导式
def put(n):
    return {i:fib(i) for i in range(n)}
print(put(5))

[1, 1, 2, 3, 5]
{0: 1, 1: 1, 2: 2, 3: 3, 4: 5}

3. 函数式编程

善用一些函数式编程技巧，提高编程效率。

Lambda函数
python内置函数

sum：求和
all：有一个None就返回False
any：有一个不是None，就返回True
reduce：自定义求和方式

高阶函数

3.1. Lambda函数

Lambda定义的函数，与def定义的函数是等价的，但是在形式上更简单。

f = lambda a, b : a + b
print(f(1, 2))

def f(a, b):
    return a + b
print(f(1, 2))

3
3

Lambda与其它迭代器对象结合使用，有时会十分方便。例如，生成一个完全平方数列：

# 生成一个完全平方数列
x = list(map(lambda x : x * x, range(11)))
print(x)
# 找到数列中以‘1’结尾的数字，组成一个新的数列
x = list(filter(lambda x : str(x).endswith("1"), x))
print(x)

[0, 1, 4, 9, 16, 25, 36, 49, 64, 81, 100]
[1, 81]

3.2. python内置函数

关于python内置函数，下面给出几个示例代码。其中all和any常用于有效数据的筛选。

x = [1, 2, 3, 4, 5]
print(sum(x))
x = [1, 2, 3, None, 5]
print(all(x))
x = [None, None, 3, None, None]
print(any(x))
x = ['a', 'b', 'c', 'd']
reduce(lambda x, y : x * 2 + y, x)

15
False
True
'aabaabcaabaabcd'

reduce可能看起来不太好懂，其实这里的“求和”对于字符串而言就是“连接”，x作为之前的和传入，y就是下一项，（其实和sum的求和还是很相似的，可以仔细比较一下）。过程如下：

a * 2 + b = aab
aab * 2 + c = aabaabc
aabaabc * 2 + d = aabaabcaabaabcd

3.3. 高阶函数

在python中，函数其实可以玩得挺花。例如，函数可以作为返回值，也可以作为函数的参数。

# 1. 函数作为返回值
# 这里例子中，函数k()的定义受函数f()的控制
def f(n):
    def k(x):
        return n * x
    return k

F = f(3)
print(F(2))    

# 2. 函数作为参数
def F(x, f):
    x = f(x)
    return x * x
print(F(1, lambda x : x + 1))

6
4

4. 函数式编程的应用

对于一个任务，先梳理需求，把共性、重复的地方抽象出来，再统一安排。
例如下面的任务：

将两个image文件夹归类至dataset/image文件夹，并将文件按照顺序重新编号

待处理数据集结构：

- PlantSegmentationDatasets
	- vinecuttings
		- images
		- masks
	- weeds
		- weed50images
		- weed50masks

images文件夹中都是".JPG"后缀的文件，weed50images中既有".JPG"也有".png"。

首先，我们要得到待复制的所有文件，

dir_1 = "/home/aistudio/PlantSegmentationDatasets/vinecuttings/images/" 
dir_2 = "/home/aistudio/PlantSegmentationDatasets/weeds/weed50images/"


# 1. glob模糊匹配
paths = glob(dir_1 + "*.JPG")
for path in paths[:5]:
    print(path)
    
# 2. 列表推导式 --> 匹配多种文件后缀
#   此时得到了一个两层嵌套的列表 [[], [], [], []]
ends = ["*.JPG", "*.jpg", "*.png", "*.jpeg"]
paths = [glob(dir_2 + end) for end in ends]
print(paths)

# 3. reduce（求和） --> 拼接嵌套列表为一层
paths = reduce(lambda x, y : x + y, paths)
for path in paths[:5]:
    print(path)

输出：

输出内容过长， 已自动对输出内容进行截断
/home/aistudio/PlantSegmentationDatasets/vinecuttings/images/DSC00149.JPG
/home/aistudio/PlantSegmentationDatasets/vinecuttings/images/DSC00241.JPG
/home/aistudio/PlantSegmentationDatasets/vinecuttings/images/DSC00248.JPG
/home/aistudio/PlantSegmentationDatasets/vinecuttings/images/DSC00214.JPG
/home/aistudio/PlantSegmentationDatasets/vinecuttings/images/DSC00200.JPG

[['/home/aistudio/PlantSegmentationDatasets/weeds/weed50images/08192020_NikonD3300_YL_SpurredAnoda_0026.JPG', '/home/aistudio/PlantSegmentationDatasets/weeds/weed50images/08192020_NikonD3300_YL_SpurredAnoda_035.JPG'], [], ['/home/aistudio/PlantSegmentationDatasets/weeds/weed50images/08192020_NikonD3300_YL_Carpetweed_0035-YuzhenLu(C).png', '/home/aistudio/PlantSegmentationDatasets/weeds/weed50images/08192020_NikonD3300_YL_Carpetweed_0021-YuzhenLu(B).png', '/home/aistudio/PlantSegmentationDatasets/weeds/weed50images/08192020_NikonD3300_YL_Carpetweed_0031-YuzhenLu.png', '/home/aistudio/PlantSegmentationDatasets/weeds/weed50images/08192020_NikonD3300_YL_Carpetweed_0035-YuzhenLu(A).png', '/home/aistudio/PlantSegmentationDatasets/weeds/weed50images/08192020_NikonD3300_YL_Carpetweed_0017-YuzhenLu(B).png', '/home/aistudio/PlantSegmentationDatasets/weeds/weed50images/08192020_NikonD3300_YL_Carpetweed_0042-YuzhenLu.png', '/home/aistudio/PlantSegmentationDatasets/weeds/weed50images/08192020_Nikon

/home/aistudio/PlantSegmentationDatasets/weeds/weed50images/08192020_NikonD3300_YL_SpurredAnoda_0026.JPG
/home/aistudio/PlantSegmentationDatasets/weeds/weed50images/08192020_NikonD3300_YL_SpurredAnoda_035.JPG
/home/aistudio/PlantSegmentationDatasets/weeds/weed50images/08192020_NikonD3300_YL_Carpetweed_0035-YuzhenLu(C).png
/home/aistudio/PlantSegmentationDatasets/weeds/weed50images/08192020_NikonD3300_YL_Carpetweed_0021-YuzhenLu(B).png
/home/aistudio/PlantSegmentationDatasets/weeds/weed50images/08192020_NikonD3300_YL_Carpetweed_0031-YuzhenLu.png

下面是完整的代码：

# 将in_dirs里每个目录的图片，分别复制到同一个out_dir中，并为它们重新编号
def copy_dir(in_dirs, out_dir):
    !mkdir $out_dir  # 创建文件夹
    for j, in_dir in enumerate(in_dirs):
        ends = ["*.JPG", "*.png", "*.jpg", "*.jpeg"]
        paths = reduce(lambda x, y : x + y, [glob(in_dir + end) for end in ends])
        for i, in_filename in enumerate(paths):
            out_filename = out_dir + str(j) + "_" + str(i) + ".jpg"
            print(out_filename)
            !cp $in_filename $out_filename  # 复制图片
            
dir_1 = "/home/aistudio/PlantSegmentationDatasets/vinecuttings/images/" 
dir_2 = "/home/aistudio/PlantSegmentationDatasets/weeds/weed50images/"
out_dir = "/home/aistudio/data/image/"
in_dirs = [dir_1, dir_2]
copy_dir(in_dirs, out_dir)

更多的应用，就以后在实践中慢慢摸索咯。

完

有关【笔记】效率之门——Python中的函数式编程技巧的更多相关文章

ruby - 如何从 ruby 中的字符串运行任意对象方法？ - 2
总的来说，我对ruby还比较陌生，我正在为我正在创建的对象编写一些rspec测试用例。许多测试用例都非常基础，我只是想确保正确填充和返回值。我想知道是否有办法使用循环结构来执行此操作。不必为我要测试的每个方法都设置一个assertEquals。例如:describeitem,"TestingtheItem"doit"willhaveanullvaluetostart"doitem=Item.new#HereIcoulddotheitem.name.shouldbe_nil#thenIcoulddoitem.category.shouldbe_nilendend但我想要一些方法来使用
ruby - 其他文件中的 Rake 任务 - 2
我试图在一个项目中使用rake，如果我把所有东西都放到Rakefile中，它会很大并且很难读取/找到东西，所以我试着将每个命名空间放在lib/rake中它自己的文件中，我添加了这个到我的rake文件的顶部:Dir['#{File.dirname(__FILE__)}/lib/rake/*.rake'].map{|f|requiref}它加载文件没问题，但没有任务。我现在只有一个.rake文件作为测试，名为“servers.rake”，它看起来像这样:namespace:serverdotask:testdoputs"test"endend所以当我运行rakeserver:testid时
ruby-on-rails - Ruby net/ldap 模块中的内存泄漏 - 2
作为我的Rails应用程序的一部分，我编写了一个小导入程序，它从我们的LDAP系统中吸取数据并将其塞入一个用户表中。不幸的是，与LDAP相关的代码在遍历我们的32K用户时泄漏了大量内存，我一直无法弄清楚如何解决这个问题。这个问题似乎在某种程度上与LDAP库有关，因为当我删除对LDAP内容的调用时，内存使用情况会很好地稳定下来。此外，不断增加的对象是Net::BER::BerIdentifiedString和Net::BER::BerIdentifiedArray，它们都是LDAP库的一部分。当我运行导入时，内存使用量最终达到超过1GB的峰值。如果问题存在，我需要找到一些方法来更正我的代
python - 如何使用 Ruby 或 Python 创建一系列高音调和低音调的蜂鸣声？ - 2
关闭。这个问题是opinion-based.它目前不接受答案。想要改进这个问题？更新问题，以便editingthispost可以用事实和引用来回答它.关闭4年前。Improvethisquestion我想在固定时间创建一系列低音和高音调的哔哔声。例如:在150毫秒时发出高音调的蜂鸣声在151毫秒时发出低音调的蜂鸣声200毫秒时发出低音调的蜂鸣声250毫秒的高音调蜂鸣声有没有办法在Ruby或Python中做到这一点？我真的不在乎输出编码是什么(.wav、.mp3、.ogg等等)，但我确实想创建一个输出文件。
ruby-on-rails - Rails 3 中的多个路由文件 - 2
Rails2.3可以选择随时使用RouteSet#add_configuration_file添加更多路由。是否可以在Rails3项目中做同样的事情？最佳答案在config/application.rb中:config.paths.config.routes在Rails3.2(也可能是Rails3.1)中，使用:config.paths["config/routes"] 关于ruby-on-rails-Rails3中的多个路由文件，我们在StackOverflow上找到一个类似的问题
ruby-on-rails - Rails - 一个 View 中的多个模型 - 2
我需要从一个View访问多个模型。以前，我的links_controller仅用于提供以不同方式排序的链接资源。现在我想包括一个部分(我假设)显示按分数排序的顶级用户(@users=User.all.sort_by(&:score))我知道我可以将此代码插入每个链接操作并从View访问它，但这似乎不是“ruby方式”，我将需要在不久的将来访问更多模型。这可能会变得很脏，是否有针对这种情况的任何技术？注意事项:我认为我的应用程序正朝着单一格式和动态页面内容的方向发展，本质上是一个典型的网络应用程序。我知道before_filter但考虑到我希望应用程序进入的方向，这似乎很麻烦。最终从任何
ruby-on-rails - Rails 3.2.1 中 ActionMailer 中的未定义方法 'default_content_type=' - 2
我在我的项目中添加了一个系统来重置用户密码并通过电子邮件将密码发送给他，以防他忘记密码。昨天它运行良好(当我实现它时)。当我今天尝试启动服务器时，出现以下错误。=>BootingWEBrick=>Rails3.2.1applicationstartingindevelopmentonhttp://0.0.0.0:3000=>Callwith-dtodetach=>Ctrl-CtoshutdownserverExiting/Users/vinayshenoy/.rvm/gems/ruby-1.9.3-p0/gems/actionmailer-3.2.1/lib/action_mailer
ruby-on-rails - Rails 应用程序中的 Rails : How are you using application_controller. rb 是新手吗？ - 2
刚入门rails，开始慢慢理解。有人可以解释或给我一些关于在application_controller中编码的好处或时间和原因的想法吗？有哪些用例。您如何为Rails应用程序使用应用程序Controller？我不想在那里放太多代码，因为据我了解，每个请求都会调用此Controller。这是真的？最佳答案 ApplicationController实际上是您应用程序中的每个其他Controller都将从中继承的类(尽管这不是强制性的)。我同意不要用太多代码弄乱它并保持干净整洁的态度，尽管在某些情况下ApplicationContr
ruby-on-rails - form_for 中不在模型中的自定义字段 - 2
我想向我的Controller传递一个参数，它是一个简单的复选框，但我不知道如何在模型的form_for中引入它，这是我的观点:{:id=>'go_finance'}do|f|%>Transferirde:para:Entrada:"input",:placeholder=>"Quantofoiganho?"%>Saída:"output",:placeholder=>"Quantofoigasto?"%>Nota:我想做一个额外的复选框，但我该怎么做，模型中没有一个对象，而是一个要检查的对象，以便在Controller中创建一个ifelse，如果没有检查，请帮助我，非常感谢,谢谢
ruby - rspec 需要 .rspec 文件中的 spec_helper - 2
我注意到像bundler这样的项目在每个specfile中执行requirespec_helper我还注意到rspec使用选项--require，它允许您在引导rspec时要求一个文件。您还可以将其添加到.rspec文件中，因此只要您运行不带参数的rspec就会添加它。使用上述方法有什么缺点可以解释为什么像bundler这样的项目选择在每个规范文件中都需要spec_helper吗？最佳答案我不在Bundler上工作，所以我不能直接谈论他们的做法。并非所有项目都checkin.rspec文件。原因是这个文件，通常按照当前的惯例，只