map_region_草庐IT

java - Hadoop:你能默默丢弃一个失败的 map task 吗？

我正在使用hadoopMapReduce处理大量数据。问题是，损坏的文件偶尔会导致Map任务抛出Java堆空间错误或类似的错误。如果可能的话，最好丢弃maptask正在做的任何事情，杀死它，然后继续工作，不要在意丢失的数据。我不希望整个M/R工作因此而失败。这在hadoop中可行吗？如何实现？最佳答案您可以修改mapreduce.max.map.failures.percent参数。默认值为0。增加此参数将允许一定比例的map任务失败而不会使作业失败。您可以在mapred-site.xml中设置此参数(将应用于所有作业)，或逐个

丢弃 Hadoop section 中设 stackoverflow java mapreduce

hadoop - Hive:每当它触发 map reduce 时，它都会给我这个错误 "Can not create a Path from an empty string"，我该如何调试？

我正在使用hive0.10以及何时使用hive-e"showtables",hive-e"desctable_name"itworks!但是当我执行类似hive-e"selectcount(*)table_name使用旧版本的配置单元和新集群抛出此错误。调试此类问题的正确方法应该是什么，没有从谷歌找到任何解决问题的方法。java.lang.IllegalArgumentException:CannotcreateaPathfromanemptystringatorg.apache.hadoop.fs.Path.checkPathArg(Path.java:91)atorg.apache

amp 每当 hadoop apache java hive

java - 我无法在以独立模式配置的 hadoop 上执行 map-reduce 作业

我正在尝试在我的计算机(MacOS10.7)上的本地文件系统(独立模式)上测试一个非常简单的hadoopmap-reduce作业。该作业采用.csv文件(data-01)并计算某些字段的出现次数。我下载了CDH4hadoop，运行作业，它似乎正常启动，但在处理完所有拆分后，我收到以下错误:13/03/1212:11:18INFOmapred.MapTask:Processingsplit:file:/path/in/data-01:9999220736+3355443213/03/1212:11:18INFOmapred.MapTask:Mapoutputcollectorclass=

map-reduce hadoop mapred MapTask java heap-memory

hadoop - SVD 实现 map reduce

您好，我需要使用MapReduce对大型密集方形矩阵执行奇异值分解。我已经查看了Mahout项目，但他们提供的是TSQR算法http://arbenson.github.io/portfolio/Math221/AustinBenson-math221-report.pdf.问题是我想要满级，这种方法在这种情况下不起作用。他们之前使用的分布式LanczosSVD实现也不适合我的情况。我发现TWO-SIDEDJACOBISCHEME可以用于此目的，但我没有设法找到任何可用的实现。有人知道我是否以及在哪里可以找到引用代码吗？最佳答案

hadoop reduce section noreferrer mllib-dimensionality-reduction mapreduce svd

file - Map在Hadoop下运行时应该把临时文件放在哪里

我在SLES10(SUSE)下运行Hadoop0.20.1。我的maptask获取一个文件并生成更多文件，然后我从这些文件生成我的结果。我想知道我应该把这些文件放在哪里，这样性能才会好并且没有冲突。如果Hadoop可以自动删除该目录，那就太好了。现在，我正在使用临时文件夹和任务ID创建一个唯一的文件夹，然后在该文件夹的子文件夹中工作。reduceTaskId=job.get("mapred.task.id");reduceTempDir=job.get("mapred.temp.dir");StringmyTemporaryFoldername=reduceTempDir+File.s

Hadoop file section DistributedCache map local temporary

hadoop - 为什么map任务总是在单个节点上运行

我有一个具有4个节点的全分布式Hadoop集群。当我将我的工作提交给Jobtracker时，它决定12个maptask对我的工作来说很酷，一些奇怪的事情发生了。12个maptask总是在单个节点上运行，而不是在单个节点上运行在整个集群上运行。在我问这个问题之前，我已经做了以下事情:尝试不同的工作运行start-balance.sh重新平衡集群但是它不起作用，所以我希望有人能告诉我为什么以及如何修复它。最佳答案如果输入数据文件的所有block都在该节点中，则调度程序优先考虑同一节点关

hadoop map section stackoverflow questions mapreduce hdfs

hadoop - 我的配置单元表有类型为 map<String,String> 的列。我想分解 map 并将它们转置为列而不是行

以下是我的hive表结构data_dtstringidstringrecordsmap按data_dt划分。当我运行查询时，selectid,key,valfromtestlateralviewexplode(records)taskey,val根据Hive文档，我的maprecords被分解成数据行。我需要按列而不是按行的分解数据。例如:上面的查询会产生我abc|k1|v1abc|k2|v2abc|k3|v3zxc|k1|v1zxc|k3|v3相反，我需要它如下id|k1|k2|k3abc|v1|v2|v3zxc|v3|/N|v3我知道explode是一个UDTF，因此它将结果转储为

配置单 String code section pre hadoop hive

java - 具有递归 Map 的 Hadoop MapReduce

我需要用Java做一个MapReduce应用程序，它需要自动递归，这意味着对于处理的每一行输入文件，它必须检查输入/映射条目的所有行是否有条件，并由函数验证。或者，换句话说，Reducer应该为接收到的每一对(键、值)调用/读取所有Map。在Hadoop框架上实现它的最佳方式是什么？我可以通过读取输入n次或将输入加载到HashMap中来以编程方式执行此操作，但我认为在MapReduce范例中可能会完成这一切。感谢您的帮助/提示!编辑:更多细节，我有(作为其他工作的结果)问题空间分区列表(索引，计数)并希望作为输出(索引，sumOfNearestNeighborsCounts)，所以对于

MapReduce Hadoop count code I1 java recursion

algorithm - 用于从图中删除循环的 Map Reduce 算法

这question对于检测有向图中的循环有一个很好的答案。不幸的是，制作它的MapReduce版本似乎并不容易。具体来说，我对用于从有向图中删除循环的MapReduce算法感兴趣。我已经使用广度优先搜索(BFS)算法进行了评估，但我看到的一个问题是可能会同时删除两个不同的边以切断一个循环。这种情况的影响是可以删除太多边。重要的是删除循环，同时尽量减少删除的边数。有证明的方案优先!谢谢。最佳答案您需要一个迭代mapreduce来实现这个算法。参见http://www.iterativemapreduce.org/对于以迭代mapr

图中 algorithm section reduce noreferrer graph hadoop mapreduce graph-algorithm

hadoop - Map Reduce 保持输入顺序

我尝试使用hadoop实现一个处理文本文件的应用程序。问题是我无法保持输入文本的顺序。有什么方法可以选择哈希函数吗？这个问题可以通过分配分区轻松解决输入到每个映射器，然后将分区发送到reducers。这可以用hadoop实现吗？最佳答案 MapReduce的基本思想是，事情完成的顺序是无关紧要的。所以你不能(也不需要)控制以下顺序:输入记录通过映射器。键和相关值通过缩减器。您唯一可以控制的是值在迭代器中的放置顺序，该顺序在缩减器中可用。这是使用称为“二级排序”的结构完成的。thisterm的简单谷歌操作导致您可以继续的几个点。我喜

hadoop Reduce section 射器 mapreduce