elastic-mapreduce-cli

hadoop - 使用 Hector 对 Cassandra 数据运行 mapreduce

我一直在尝试使用Java客户端“HECTOR”对存储在Cassandra中的数据运行简单的map-reduce作业。我已经成功运行了这个漂亮的blogpost中解释的hadoop-wordcount示例.我也读过HadoopSupport文章。但我想做的在实现方面有点不同(wordcount示例使用一个脚本，其中提到了mapreduce-site.xml)。我希望有人能帮助我了解如何在分布式模式下运行map-reduce作业，而不是在cassandra数据上从“HECTOR”本地运行。我的代码在本地模式下成功运行map-reduce作业。但我想要的是在分布式模式下运行它们并将结果作为新

Cassandra mapreduce 34 code job hadoop hector

Hadoop MapReduce 思维

我是hadoopmapreduce框架领域的新手。自己看了很多教程，了解了框架。我已经在伪分布式模式下成功配置了一个hadoop设置。我有两个特定任务需要在HadoopMapReduce中完成。我有许多具有以下格式的数据文件。交换消息的数量；用户1；用户2；时间戳；例如:5；约翰·多伊；约翰·史密斯;1900年1月1日；我想完成的是对用户名进行数据屏蔽(例如在用户名之上构建SHA256，以便它们是匿名的。)汇总给定时间段(比如1周)内交换的消息数现在让我们来回答我的问题:据我目前的了解，hadoopmapreduce框架就是为了完成第二个任务。我可以映射键值(交换消息的两个用户名，消息

MapReduce Hadoop section

hadoop - 使用 Hadoop/Mapreduce 计算数字的平均值

我正在使用Hadoop/Mapreduce计算数字的平均值有结构guidbanidcountviewg1b11g1b21g1b12g1b11g2b11g2b21g2b11g2b31g3b11我想要每个guidbanid的平均countview计数？(我的想法是average=5/2withguidg1(2是总数另一个banid:b1，b2)) 最佳答案因此，如果我理解您的问题，您正在寻找的答案可能如下所示:g1b11g1b21g1b12g1b11Averagefor"g1"=5/2(totalcount/uniquebanidco

Mapreduce hadoop strong section banid numbers average

java - 向 reducer-MapReduce 发送多个参数

我编写了一个代码，它执行类似于SQLGroupBy的操作。我拿的数据集在这里:250788681419,20090906,200937,200909,619,SUNDAY,WEEKEND,ON-NET,MORNING,OUTGOING,VOICE,25078,PAY_AS_YOU_GO_PER_SECOND_PSB,SUCCESSFUL-RELEASEDBYSERVICE,17,0,1,21.25-10-1452-1452-17publicclassMyMapextendsMapper{publicvoidmap(LongWritablekey,Textvalue,Contextcon

reducer-MapReduce MapReduce public DoubleWritable attribute java hadoop

hadoop - 将环境变量传递给 Hive Transform 或 MapReduce

我正在尝试将自定义环境变量传递给Hive转换中使用的可执行文件(下例中的my-mapper.script)例如:SELECTTRANSFORM(x,y,z)USING'my-mapper.script'FROM(SELECTx,y,zFROMtable)我知道在Hadoop流中可以使用-cmdenvEXAMPLE_DIR=/home/example/dictionaries/但我不知道如何在HiveTransform/MapReduce中执行此操作。有什么想法吗？最佳答案您可以使用简单的两行bash脚本包装您的脚本来设置环境。例

Transform MapReduce section code my-mapper hadoop hive hadoop-streaming

hadoop - Hive CLI '-e' 和 '-f' 选项不起作用

我正在使用Horton-worksHadoop解决方案，但无法执行配置单元命令行界面命令。使用-e选项，命令如下C:\somepath\hive-0.11\bin>hive-e'select*fromsampletable'在这里，我得到了错误'ParseException',cannotrecognizeinputnear'',''inselectclause.使用-f选项，命令如下C:\somepath\hive-0.11\bin>hive-f/user/myusername/sample.sql这里报错unabletoreadthefileatspecifiedlocation.

amp 39 section code blockquote hadoop hive hortonworks-data-platform

hadoop - 原生 mapreduce VS hbase mapreduce

如果我使用TableMapReduceUtil(Hbase)创建MR作业，似乎hbase扫描器将数据馈送到映射器并将数据从reducer转换为特定的hbase输出格式以将其存储在hbase表中。出于这个原因，我预计hbasemapreduce作业将比本地MR作业花费更多时间。那么，Hbase作业比原生MR需要多长时间？最佳答案关于通过HBase进行的读取可能比直接使用文件的本地map/reduce慢2-3倍。在recentlyannouncedHBase0.98他们添加了对HBase快照进行映射/缩减的功能。可以看到thispr

mapreduce hadoop section hbase

java - Hadoop MapReduce - 如何提高并行度

我遇到了一个问题。我有一个包含机场和航类信息的数据集(CSV文件)，例如机场代码、航类代码、航类到达日期和时间、航类应该到达的日期和时间等。现在，我有数据集只有两年-2006年和2007年。我正在使用javamapreduceAPI作为解决方案。我必须找出两年内每个机场的平均航类延迟，并将输出存储在两个单独的文件中-一个用于2006年，另一个用于2007年。输出还应按airportCode排序。我的方法是这样的:FullDataset->map()->->customPartitionertopartitiononlybyyear->reduce((year,airportCode),

MapReduce Hadoop section airportCode reduce java

hadoop - HDInsight hadoop-mapreduce-examples.jar 输出在哪里？

我在HDInsight中运行示例wordcount应用程序命令成功运行，但我找不到输出。我运行的命令是hadoopjarhadoop-mapreduce-examples.jarwordcount/example/data/gutenberg/davinci.txt/user/joe/WordCountOutput我期待在文件系统上创建一些东西。但我没有看到/user/joe/创建。请指教。最佳答案默认情况下，HDInsight使用Azureblob存储作为其HDFS存储，因此您的输出位于与集群关联的存储帐户中。你可以使用类似C

hadoop hadoop-mapreduce-examples section mapreduce hdfs azure-hdinsight

hadoop - Hive CLI 如何从 HDFS 中检索巨大的结果文件？

在我通过CLI执行配置单元查询后，如下所示:$hive-eQUERY>output.txtHive客户端将编译QUERY并将其发送到Hadoop集群。Hadoop执行一些作业并将结果输出到文件(假设仅1个reducer)在HDFS。然后Hive客户端将检索这个单个文件，提取它，并输出到本地STDOUT。流程如下图所示:==============HadoopCluster==============|||||2.outputRESULTasasingle.gzfileatHDFSbecauseof1reducer||||1.QUERY||||3.HiveretrievestheRESU

hadoop Hive section code beeline

244 245 246247248 249 250