c++ - 编译器优化 : g++ slower than intel

coder 2023-06-02 原文

我最近购买了一台双启动计算机，可以用 C++ 编写代码。在 Windows 上，我在 linux 上使用英特尔 C++ 编译器和 g++。
我的程序主要由计算组成(具有数值积分的定点迭代算法等)。
我以为我可以在我的 linux 上获得接近 windows 的性能，但到目前为止我还没有:对于完全相同的代码，使用 g++ 编译的程序比使用 intel 编译器的程序慢大约 2 倍。从我读到的内容来看，icc 可以更快，甚至可能提高 20-30%，但我没有读到任何关于它快两倍的内容(总的来说，我实际上读到两者应该是等效的)。

起初我使用的标志大致等效:

icl /openmp /I "C:\boost_1_61_0" /fast program.cpp

和

g++ -o program program.cpp -std=c++11 -fopenmp -O3 -ffast-math

遵循其他几个主题的建议，我尝试添加/替换其他几个标志，例如:-funsafe-math-optimizations、-march=native、-fwhole-program、-Ofast 等，但只有轻微(或没有)性能提升。

icc 真的更快还是我错过了什么？
我对 linux 相当陌生，所以我不知道，也许我忘记正确安装某些东西(例如驱动程序)，或者更改 g++ 中的某些选项？我不知道情况是否正常，所以我更愿意问。特别是因为我更喜欢使用 linux 进行理想的编码，所以我宁愿让它跟上速度。

编辑:我决定在 linux 上安装最后一个 intel 编译器(Intel Compiler C++ 17, update4)来检查。我最终得到了减轻的结果:它并不比 gcc 做得更好(实际上更糟)。
我运行交叉比较 linux/windows - icc/gcc - 是否并行，使用帖子前面提到的标志(进行直接比较)，这是我的结果(运行 1 次迭代的时间以毫秒为单位):

普通循环，无并行化:

视窗:
gcc = 122074 ； icc = 68799

Linux:
gcc = _91042; icc = 92102

并行版本:

视窗:
gcc = 27457； icc = 19800

Linux:
gcc = 27000 ; ICC = 30000

总结一下:有点乱。
在 linux 上，gcc 似乎总是比 icc 快，尤其是在涉及并行化时(我为更长的程序运行了它，差异比这里的高得多)。
在 Windows 上，情况正好相反，icc 显然支配了 gcc，尤其是在没有并行化的情况下(在这种情况下，gcc 需要很长时间来编译)。

最快的编译是通过 Windows 上的并行化和 icc 完成的。我不明白为什么我不能在 linux 上复制它。我需要做些什么(ubuntu 16.04)来帮助我加快流程？
另一个区别是，在 Windows 上我使用较旧的 intel composer ( Composer XE 2013 ) 并调用 'ia32' 而不是 intel64(这是我应该使用的)，而在 linux 上我使用最后一个版本我昨天安装的。在 linux 上，Intel Compiler 17 文件夹在我的第二个硬盘上(而不是我安装 linux 的 ssd)我不知道这是否也会减慢速度。
知道问题可能来自哪里吗？

编辑:确切的硬件:
Intel(R) Core(TM) i7-4710HQ CPU @ 2.50GHz，8 个 CPU，4 个内核，每个内核 2 个线程，架构 x86_64
- 带有 gcc 5.4.1 和 Intel Compiler 17 (update4) 的 Linux Ubuntu 16.04
- Windows 8.1，英特尔 Composer 2013

编辑:代码很长，这是我正在测试的循环形式(即我的定点迭代的一次迭代)。我想这是非常经典的……不确定它可以为主题带来什么。

// initialization of all the objects...
// length_grid1 is about 2000
vector< double > V_NEXT(length_grid1), PRICE_NEXT(length_grid1);
double V_min, price_min; 
#pragma omp parallel
{ 
#pragma omp for private(V_min, price_min, i, indexcurrent, alpha, beta)
    for (i = 0; i < length_grid1; i++) {
         indexcurrent = indexsum[i]; 
         V_min = V_compute(&price_min, indexcurrent, ...);
         V_NEXT[indexcurrent] = V_min; PRICE_NEXT[indexcurrent] = price_min;
     }
 }// end parallel

其中 V_compute 函数是一个经典而简单的优化算法(自定义黄金搜索)，返回最优值及其参数:

double V_compute(double *xmin, int row_index, ... ) {
double x1, x2, f1, f2, fxmin;
// golden_ratio=0.61803399; 
x1 = upper_bound - golden_ratio*(upper_bound - lower_bound);
x2 = lower_bound + golden_ratio*(upper_bound - lower_bound);

// Evaluate the function at the test points
f1 = intra_value(x1, row_index, ...);
f2 = intra_value(x2, row_index, ...);

while (fabs(upper_bound - lower_bound) > tolerance) {
    if (f2 > f1){
        upper_bound = x2; x2 = x1; f2 = f1;
        x1 = upper_bound - golden_ratio*(upper_bound - lower_bound);
        f1 = intra_value(x1, row_index, ...);
    } else {
        lower_bound = x1; x1 = x2; f1 = f2;
        x2 = lower_bound + golden_ratio*(upper_bound - lower_bound);
        f2 = intra_value(x2, row_index, ...);
    }
}
// Estimated minimizer = (lower bound + upper bound) / 2
*xmin = (lower_bound + upper_bound)/2;
fxmin = intra_value(*xmin, row_index, ...);
return - fxmin; }

优化的函数(intra_value)在计算方面相当复杂(从预编译的网格中选择一个网格点(row_index)，然后涉及大量的数值积分等)。

最佳答案

看起来您正在使用 OpenMP，所以我怀疑区别在于 OpenMP 实现，而不仅仅是优化代码的质量。

众所周知，英特尔的 OpenMP 运行时性能非常高，而 GCC 的性能很好但不是很好。

OpenMP 程序具有非常不同的性能特征，它们不仅仅取决于编译器优化循环或内联函数调用的能力。 OpenMP 运行时的实现以及线程和同步原语的操作系统实现非常重要，这在 Windows 和 GNU/Linux 之间有很大的不同。

关于c++ - 编译器优化 : g++ slower than intel，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/44370120/

amp 43 br bound strong c++performance g++intel compiler-optimization

有关c++ - 编译器优化 : g++ slower than intel的更多相关文章

ruby-on-rails - 如何优雅地重启 thin + nginx？ - 2
我的瘦服务器配置了nginx，我的ROR应用程序正在它们上运行。在我发布代码更新时运行thinrestart会给我的应用程序带来一些停机时间。我试图弄清楚如何优雅地重启正在运行的Thin实例，但找不到好的解决方案。有没有人能做到这一点？最佳答案 #Restartjustthethinserverdescribedbythatconfigsudothin-C/etc/thin/mysite.ymlrestartNginx将继续运行并代理请求。如果您将Nginx设置为使用多个上游服务器，例如server{listen80;server
ruby - Sinatra set cache_control to static files in public folder编译错误 - 2
我不知道为什么，但是当我设置这个设置时它无法编译设置:static_cache_control，[:public，:max_age=>300]这是我得到的syntaxerror,unexpectedtASSOC,expecting']'(SyntaxError)set:static_cache_control,[:public,:max_age=>300]^我只想将“过期”header设置为css、javaascript和图像文件。谢谢。最佳答案我猜您使用的是Ruby1.8.7。Sinatra文档中显示的语法似乎是在Ruby1.
ruby - 使用 `+=` 和 `send` 方法 - 2
如何将send与+=一起使用？a=20;a.send"+=",10undefinedmethod`+='for20:Fixnuma=20;a+=10=>30 最佳答案恐怕你不能。+=不是方法，而是语法糖。参见http://www.ruby-doc.org/docs/ProgrammingRuby/html/tut_expressions.html它说Incommonwithmanyotherlanguages,Rubyhasasyntacticshortcut:a=a+2maybewrittenasa+=2.你能做的最好的事情是:
安卓apk修改(Android反编译apk) - 2
最近因为项目需要，需要将Android手机系统自带的某个系统软件反编译并更改里面某个资源，并重新打包，签名生成新的自定义的apk，下面我来介绍一下我的实现过程。APK修改，分为以下几步：反编译解包,修改,重打包,修改签名等步骤。安卓apk修改准备工作1.系统配置好JavaJDK环境变量2.需要root权限的手机（针对系统自带apk,其他软件免root）3.Auto-Sign签名工具4.apktool工具安卓apk修改开始反编译本文拿Android系统里面的Settings.apk做demo,具体如何将apk获取出来在此就不过多介绍了，直接进入主题：按键win+R输入cmd，打开命令窗口，并将路
ruby - 如何计算 Liquid 中的变量 +1 - 2
我对如何计算通过{%assignvar=0%}赋值的变量加一完全感到困惑。这应该是最简单的任务。到目前为止，这是我尝试过的:{%assignamount=0%}{%forvariantinproduct.variants%}{%assignamount=amount+1%}{%endfor%}Amount:{{amount}}结果总是0。也许我忽略了一些明显的东西。也许有更好的方法。我想要存档的只是获取运行的迭代次数。最佳答案因为{{incrementamount}}将输出您的变量值并且不会影响{%assign%}定义的变量，我
arrays - Ruby 数组 += vs 推送 - 2
我有一个数组数组，想将元素附加到子数组。+=做我想做的，但我想了解为什么push不做。我期望的行为(并与+=一起工作):b=Array.new(3,[])b[0]+=["apple"]b[1]+=["orange"]b[2]+=["frog"]b=>[["苹果"],["橙子"],["Frog"]]通过推送，我将推送的元素附加到每个子数组(为什么？):a=Array.new(3,[])a[0].push("apple")a[1].push("orange")a[2].push("frog")a=>[[“苹果”、“橙子”、“Frog”]、[“苹果”、“橙子”、“Frog”]、[“苹果”、“
+= 的 Ruby 方法 - 2
有没有办法让Ruby能够做这样的事情？classPlane@moved=0@x=0defx+=(v)#thisiserror@x+=v@moved+=1enddefto_s"moved#{@moved}times,currentxis#{@x}"endendplane=Plane.newplane.x+=5plane.x+=10putsplane.to_s#moved2times,currentxis15 最佳答案您不能在Ruby中覆盖复合赋值运算符。任务在内部处理。您应该覆盖+，而不是+=。plane.a+=b与plane.a=
.net - 是否有 Ruby .NET 编译器？ - 2
是否有适用于Ruby语言的.NETFramework编译器？我听说过DLR(动态语言运行时)，这是否将使Ruby能够用于.NET开发？最佳答案 IronRuby是Microsoft支持的项目，建立在动态语言运行时之上。关于.net-是否有Ruby.NET编译器？，我们在StackOverflow上找到一个类似的问题： https://stackoverflow.com/questions/199638/
ruby - Sinatra + Heroku + Datamapper 使用 dm-sqlite-adapter 部署问题 - 2
出于某种原因，heroku尝试要求dm-sqlite-adapter，即使它应该在这里使用Postgres。请注意，这发生在我打开任何URL时-而不是在gitpush本身期间。我构建了一个默认的Facebook应用程序。gem文件:source:gemcuttergem"foreman"gem"sinatra"gem"mogli"gem"json"gem"httparty"gem"thin"gem"data_mapper"gem"heroku"group:productiondogem"pg"gem"dm-postgres-adapter"endgroup:development,:t
ruby - Ruby 中字符串运算符 + 和 << 的区别 - 2
我是Ruby和这个网站的新手。下面两个函数是不同的，一个在函数外修改变量，一个不修改。defm1(x)x我想确保我理解正确-当调用m1时，对str的引用被复制并传递给将其视为x的函数。运算符当调用m2时，对str的引用被复制并传递给将其视为x的函数。运算符+创建一个新字符串，赋值x=x+"4"只是将x重定向到新字符串，而原始str变量保持不变。对吧？谢谢最佳答案 String#+::str+other_str→new_strConcatenation—ReturnsanewStringcontainingother_strconc

c++ - 编译器优化 : g++ slower than intel

有关c++ - 编译器优化 : g++ slower than intel的更多相关文章

随机推荐