高性能计算实验——矩阵乘法基于MPI的并行实现及优化

Flechazo_z 2024-06-23 原文

高性能计算实验——矩阵乘法基于MPI的并行实现及优化

1.实验目的

1.1.通过MPI实现通用矩阵乘法

熟练掌握MPI编程方法，并将通用矩阵乘法转为MPI并行实现，进一步加深MPI的使用与理解。

1.2.基于MPI的通用矩阵乘法优化

进一步熟悉MPI矩阵乘法的实现，学习MPI点对点通信与集合通信的异同点和各自的优缺点，学会比较二者的性能以及各自使用的情形。

1.3.改造实验1成矩阵乘法库函数

学习如何将自己编写的代码改造为标准库函数，供其他程序调用。
理解动态链接的过程。

2.实验过程和核心代码

2.1.通过MPI实现通用矩阵乘法

2.1.1.问题描述
通过 MPI 实现通用矩阵乘法（实验1）的并行版本，MPI并行进程（rank size）从 1 增加至 8，矩阵规模从 512 增加至 2048.

问题描述：随机生成 MN 和NK 的两个矩阵 A,B,对这两个矩阵做乘法得到矩阵 C.
输入：M , N, K 三个整数（512 ~2048）
输出：A,B,C 三个矩阵以及矩阵计算的时间

2.1.2.实现过程
这里可以选择点对点通信或者集合通信的方式实现，这里选择点对点方式，使用MPI_Send、MPI_Recv函数进行进程通信。
思想：

最简单的实现，按行并行：
主进程不参与计算，只负责分发和收集数据。在主进程中，A根据处理器数按行划分为大致相等的N部分，然后将部分的A和全部的B传递给子进程。子进程计算部分乘法并返回结果，主进程收集并整合报告结果。使用最简单的Send和Recv进行通信。

2.1.3.核心代码
①矩阵生成

void Gen_Matrix(int m,int n,int k){
    for(int i=0;i<m;i++){
        for(int j=0;j<n;j++){
            A[i][j] = rand()%5;
        }
    }
    for(int i=0;i<n;i++){
        for(int j=0;j<k;j++){
            B[i][j] = rand()%5;
        }
    }
}

②MPI初始化

③获得进程数（通过bash）

④获得时间

⑤主处理器

这里主处理器通过Send传递给每一个处理器n/pnum行A、与整个的B，接着接受所有子处理器返回的结果进行拼接。

⑥子处理器

这里子处理器需要相应的接受Recv主处理器Send的过来的A部分行与整个的B，接着进行计算，即matMulti函数，最后Send回结果。

⑦矩阵乘法

这里就是简单的使用朴素计算方法，为了方便，直接将结果存在了部分结果矩阵返回。

2.2.通用矩阵乘法优化

2.2.1.问题描述
分别采用 MPI 点对点通信和 MPI 集合通信实现矩阵乘法中的进程之间通信，并比较两种实现方式的性能。
上面已经采用点对点通信的方式进行了实现，接下来针对集合通信来进行实验。

2.2.2.实现过程
这里分发A时，是将A平均的分配给了各个进程，使用Scatter分发比较何时，而B要完整的分发给所有处理器，所以使用Broadcast通信更为方便，收集计算结果使用Gather。

广播是最简单但也是最有用的集体操作之一。
改用Scatter分配数据后，每个进程分配的部分矩阵具有完全相等的规模。因此。记comm_sz为进程数，矩阵的维度需要是comm_sz的倍数。我们将矩阵的维度扩展到comm_sz的倍数，多余的部分用0填充，保证正确性。
改用Scatter分配数据后，计算任务平均地分配给每一个进程，所以主进程不仅要分发收集结果，也要参与计算。如果分发的行数不够，就不能保证结果正确；如果分发的行数超出，就会出现很多不同类型的内存错误（大多都源于free时内存泄漏等原因）。

2.2.3.核心代码
①给A、B矩阵赋初值

这里必须要平均分配给各个处理器，因此有必要在不够分配时扩大矩阵，就需要在无数据的位置补零。

②获取矩阵大小，这里需要假设矩阵大小相同（通过bash）

后续处理，将真实矩阵大小扩展到处理器个数的倍数。

③MPI初始化
同上第一部分；

④主线程

主线程额外进行初始化矩阵以及计算并输出时间的工作

使用Scatter平均分发A的行，Bcast分发B。

使用Gather收集结果。

⑤所有处理器计算

MatMulti函数与上面实验相同。

2.3.改造实验1成矩阵乘法库函数

2.3.1.问题描述
将Lab1 的矩阵乘法改造为一个标准的库函数 matrix_multiply（函数实现文件和函数头文件），输入参数为三个完整定义矩阵（A,B,C），定义方式没有具体要求，可以是二维矩阵，也可以是 struct 等。在 Linux 系统中将此函数编译为.so 文件，由其他程序调用。

2.3.2.实验过程
通常情况下，对函数库的链接是放在编译时期（compile）完成的。所有相关的对象文件（object file）与牵涉到的函数库（library）被链接合成一个可执行文件（executable file）。程序在运行时，与函数库再无关系，因为所有需要的函数已拷贝到自己门下。所以这些函数库被称为静态库（static libaray），通常文件名为“libxxx.a”的形式。
由于动态链接库函数的共享特性，它们不会被拷贝到可执行文件中。在编译的时候，编译器只会做一些函数名之类的检查。在程序运行的时候，被调用的动态链接库函数被安置在内存的某个地方，所有调用它的程序将指向这个代码段。因此，这些代码必须使用相对地址，而不是绝对地址。在编译的时候，我们需要告诉编译器，这些对象文件是用来做动态链接库的，所以要用地址无关代码（Position Independent Code （PIC））。
对gcc编译器，只需添加上 -fPIC 标签，如：=

gcc -fPIC -c file1.c
gcc -fPIC -c file2.c
gcc -shared libxxx.so file1.o file2.o

注意到最后一行，-shared 标签告诉编译器这是要建立动态链接库。这与静态链接库的建立很不一样，后者用的是 ar 命令。也注意到，动态链接库的名字形式为 “libxxx.so” 后缀名为 “.so”

2.3.3.核心代码
①Mat_mul.h头文件

这里自定义矩阵，包括行、列、矩阵体，同时声明需要的函数。

②Mat_mul.c头文件

Malloc_matrix函数用于根据矩阵rows\cols分配矩阵并进行初始化。

Free_matrix函数用于释放相应空间。

Mul_matrix函数是核心计算函数，会首先检查是否满足乘法条件。

3.实验结果

3.1.通过MPI实现通用矩阵乘法

编译得到相应的MPI程序；

执行得到2048大小的矩阵使用2个处理器时间消耗为186s

执行得到2048大小的矩阵使用4个处理器时间消耗为75s
结果可以看出在处理器足够的情况下，增加处理器数目可以大大提高运算速度，符合预期。

3.2.基于MPI的通用矩阵乘法优化

编译程序：

执行得到2048大小的矩阵使用4个处理器时间消耗为87s，2048大小的矩阵使用2个处理器时间消耗为140s。
结果可以看出在处理器足够的情况下，增加处理器数目可以大大提高运算速度，符合预期。

3.3.改造实验1成矩阵乘法库函数

编译为.so文件

改变当前动态库路径为当前目录

编写的测试文件；
测试结果：

查看链接：

自己的.so文件成功链接。

4.实验感想

本次实验是高性能实验的核心，主要是使用MPI进行矩阵乘法的实现与优化，总体来说并不是很难，需要掌握点对点与集群通信两种方式的MPI。
其中还有很多可以优化的点，比如传递给处理器的整个的B是没有必要的，我们可以简单的对B矩阵进行转置，接着把与传递A相同的几行传递给处理器即可，可以大大减少通信量。

有关高性能计算实验——矩阵乘法基于MPI的并行实现及优化的更多相关文章

ruby - 如何根据特征实现 FactoryGirl 的条件行为 - 2
我有一个用户工厂。我希望默认情况下确认用户。但是鉴于unconfirmed特征，我不希望它们被确认。虽然我有一个基于实现细节而不是抽象的工作实现，但我想知道如何正确地做到这一点。factory:userdoafter(:create)do|user,evaluator|#unwantedimplementationdetailshereunlessFactoryGirl.factories[:user].defined_traits.map(&:name).include?(:unconfirmed)user.confirm!endendtrait:unconfirmeddoenden
叮咚买菜基于 Apache Doris 统一 OLAP 引擎的应用实践 - 2
导读：随着叮咚买菜业务的发展，不同的业务场景对数据分析提出了不同的需求，他们希望引入一款实时OLAP数据库，构建一个灵活的多维实时查询和分析的平台，统一数据的接入和查询方案，解决各业务线对数据高效实时查询和精细化运营的需求。经过调研选型，最终引入ApacheDoris作为最终的OLAP分析引擎，Doris作为核心的OLAP引擎支持复杂地分析操作、提供多维的数据视图，在叮咚买菜数十个业务场景中广泛应用。作者｜叮咚买菜资深数据工程师韩青叮咚买菜创立于2017年5月，是一家专注美好食物的创业公司。叮咚买菜专注吃的事业，为满足更多人“想吃什么”而努力，通过美好食材的供应、美好滋味的开发以及美食品牌的孵
华为OD机试用Python实现 -【明明的随机数】 2023Q1A - 2
华为OD机试题本篇题目：明明的随机数题目输入描述输出描述：示例1输入输出说明代码编写思路最近更新的博客华为od2023|什么是华为od，od薪资待遇，od机试题清单华为OD机试真题大全，用Python解华为机试题|机试宝典【华为OD机试】全流程解析+经验分享,题型分享,防作弊指南华为o
基于C#实现简易绘图工具【100010177】 - 2
C#实现简易绘图工具一.引言实验目的:通过制作窗体应用程序(C#画图软件),熟悉基本的窗体设计过程以及控件设计,事件处理等,熟悉使用C#的winform窗体进行绘图的基本步骤,对于面向对象编程有更加深刻的体会.Tutorial任务设计一个具有基本功能的画图软件**·包括简单的新建文件,保存,重新绘图等功能**·实现一些基本图形的绘制,包括铅笔和基本形状等,学习橡皮工具的创建**·设计一个合理舒适的UI界面**注明:你可能需要先了解一些关于winform窗体应用程序绘图的基本知识,以及关于GDI+类和结构的知识二.实验环境Windows系统下的visualstudio2017C#窗体应用程序三.
MIMO-OFDM无线通信技术及MATLAB实现（1）无线信道：传播和衰落 - 2
MIMO技术的优缺点优点通过下面三个增益来总体概括：阵列增益。阵列增益是指由于接收机通过对接收信号的相干合并而活得的平均SNR的提高。在发射机不知道信道信息的情况下，MIMO系统可以获得的阵列增益与接收天线数成正比复用增益。在采用空间复用方案的MIMO系统中，可以获得复用增益，即信道容量成倍增加。信道容量的增加与min(Nt,Nr)成正比分集增益。在采用空间分集方案的MIMO系统中，可以获得分集增益，即可靠性性能的改善。分集增益用独立衰落支路数来描述，即分集指数。在使用了空时编码的MIMO系统中，由于接收天线或发射天线之间的间距较远，可认为它们各自的大尺度衰落是相互独立的，因此分布式MIMO
kvm虚拟机安装centos7基于ubuntu20.04系统 - 2
需求：要创建虚拟机，就需要给他提供一个虚拟的磁盘，我们就在/opt目录下创建一个10G大小的raw格式的虚拟磁盘CentOS-7-x86_64.raw命令格式：qemu-imgcreate-f磁盘格式磁盘名称磁盘大小qemu-imgcreate-f磁盘格式-o?1.创建磁盘qemu-imgcreate-fraw/opt/CentOS-7-x86_64.raw10G执行效果#ls/opt/CentOS-7-x86_64.raw2.安装虚拟机使用virt-install命令，基于我们提供的系统镜像和虚拟磁盘来创建一个虚拟机，另外在创建虚拟机之前，提前打开vnc客户端，在创建虚拟机的时候，通过vnc
【Java入门】使用Java实现文件夹的遍历 - 2
遍历文件夹我们通常是使用递归进行操作，这种方式比较简单，也比较容易理解。本文为大家介绍另一种不使用递归的方式，由于没有使用递归，只用到了循环和集合，所以效率更高一些！一、使用递归遍历文件夹整体思路1、使用File封装初始目录，2、打印这个目录3、获取这个目录下所有的子文件和子目录的数组。4、遍历这个数组，取出每个File对象4-1、如果File是否是一个文件，打印4-2、否则就是一个目录，递归调用代码实现publicclassSearchFile{publicstaticvoidmain(String[]args){//初始目录Filedir=newFile("d:/Dev");Datebeg
ruby - Arrays Sets 和 SortedSets 在 Ruby 中是如何实现的 - 2
通常，数组被实现为内存块，集合被实现为HashMap，有序集合被实现为跳跃列表。在Ruby中也是如此吗？我正在尝试从性能和内存占用方面评估Ruby中不同容器的使用情况最佳答案数组是Ruby核心库的一部分。每个Ruby实现都有自己的数组实现。Ruby语言规范只规定了Ruby数组的行为，并没有规定任何特定的实现策略。它甚至没有指定任何会强制或至少建议特定实现策略的性能约束。然而，大多数Rubyist对数组的性能特征有一些期望，这会迫使不符合它们的实现变得默默无闻，因为实际上没有人会使用它:插入、前置或追加以及删除元素的最坏情况步骤复
ruby - ruby 乘法语句中星号中断语法前的空格 - 2
在添加一些空格以使代码更具可读性时(与上面的代码对齐)，我遇到了这个:classCdefx42endendm=C.new现在这将给出“错误数量的参数”:m.x*m.x这将给出“语法错误，意外的tSTAR，期待$end”:2/m.x*m.x这里的解析器到底发生了什么？我使用Ruby1.9.2和2.1.5进行了测试。最佳答案 *用于运算符(42*42)和参数解包(myfun*[42,42])。当你这样做时:m.x*m.x2/m.x*m.xRuby将此解释为参数解包，而不是*运算符(即乘法)。如果您不熟悉它，参数解包(有时也称为“spl
ruby - 带括号和 splat 运算符的并行赋值 - 2
我明白了:x,(y,z)=1,*[2,3]x#=>1y#=>2z#=>nil我想知道为什么z的值为nil。最佳答案 x,(y,z)=1,*[2,3]右侧的splat*是内联扩展的，所以它等同于:x,(y,z)=1,2,3左边带括号的列表被视为嵌套赋值，所以它等价于:x=1y,z=23被丢弃，而z被分配给nil。关于ruby-带括号和splat运算符的并行赋值，我们在StackOverflow上找到一个类似的问题： https://stackoverflow

高性能计算实验——矩阵乘法基于MPI的并行实现及优化