HADOOP

hadoop - 从多个 Hive 表中获取记录而无需连接

我有2个表:表1描述:countint表2描述:count_valint我从上面的表中获取字段计数，count_val并插入到另一个审计表(table3)中。表3描述:countintcount_valint我正在尝试将这2个表的记录计数记录到每个作业运行的审计表中。感谢您的任何建议。谢谢! 最佳答案如果您只需要聚合(如求和)，解决方案是使用UNIONINSERTINTOTABLEauditSELECTSUM(count),SUM(count_val)FROM(SELECTt1.count,0ascount_valFROMtabl

java - MapReduce 中的全局变量或属性？

我希望能够在我的MR作业的映射阶段设置某种变量或标志，我可以在作业完成后检查。我认为用一些代码来展示我想要的东西的最好方法是:p.s我正在使用Hadoop2.2.0publicclassMRJob{publicstaticclassMapperTestextendsMapper{publicvoidmap(Objectkey,Textvalue,Contextcontext)throwsIOException,InterruptedException{//Dosomecomputationtogetnewvalueandkey...//Checkifnewvalueequaltosom

MapReduce java section Configuration code hadoop hadoop2

hadoop - 无法将 Hadoop 和 Java 包复制到 Google Cloud Storage

我正在尝试在GoogleComputeEngine上设置Hadoop集群，我一直在关注theseinstructions.在我运行之前，一切似乎都运行良好:./compute_cluster_for_hadoop.pysetup使用我创建的项目ID和存储桶名称。该脚本似乎无法访问某些内容并因403而崩溃；这是带有错误消息的输出的尾部:Uploading...kages/ca-certificates-java_20121112+nmu2_all.deb:14.57KB/14.57KBUploading...duce/tmp/deb_packages/libnspr4_4.9.2-1_a

包复 Storage compute_cluster_for_hadoop hadoop section google-cloud-storage google-compute-engine google-hadoop

hadoop - 在桌面上安装超过 5 个硬盘的 Hadoop

我一直在安装Hadoop。我遵循了Udemy类(class)中的一些说明，并在我的笔记本电脑上以伪分布式模式安装了Hadoop。这相当简单。之后，我开始考虑是否可以在桌面计算机上设置Hadoop。于是出去买了一个空机箱，放入一个64位8核AMD处理器，以及一个50GBSSD硬盘和4个便宜的500GB硬盘。我在SSD驱动器上安装了Ubuntu14.04，并将虚拟机放在其他驱动器上。我设想将我的SSD用作主设备，并将我的4个硬盘驱动器用作节点。同样，一切都生活在同一个案例中。不幸的是，我到处搜索，但找不到任何描述以这种方式设置Hadoop的教程、指南、书籍等。似乎大多数我发现的Hadoop

面上 hadoop strong section installation

algorithm - 如何计算布隆过滤器百分比

我正在浏览HadoopInAction并遇到了关于BloomFilter的解释，它说:Thefalsepositiverateisapproximatedbytheequation(1–exp(-kn/m))kwherekisthenumberofhashfunctionsused,misthenumberofbitsusedtostoretheBloomfilter,andnisthenumberofelementstobeaddedtotheBloomfilter.Inpractice,mandnaredeterminedbytherequirementofthesystem,an

布隆 algorithm code the section hadoop

hadoop - Hadoop 中需要 "runuser hdfs -s/bin/bash/bin/bash"

我是hadoop的新手，正在关注这个link在Fedora20中安装它。这篇文章中有一个命令:runuserhdfs-s/bin/bash/bin/bash-c"hadoopfs-mkdir/user/"在这部分命令中，我们在HDFS中创建一个目录:"hadoopfs-mkdir/user/"但是我无法理解上面命令的这一部分的用途/含义是什么:runuserhdfs-s/bin/bash/bin/bash请告诉我这个命令的确切用途/含义是什么:runuserhdfs-s/bin/bash/bin/bash 最佳答案这有点令人困惑，

bash amp code pre hadoop mapreduce hdfs

hadoop - 为什么我在安装 HDinsight 后运行了多个 Java 实例？

我在台式计算机上安装了HDInsight以学习使用Hive。当我重新启动计算机并登录我的个人资料时，一切都变慢了。我发现Hadoop正在运行Java.exe的多个实例。有没有办法限制Hadoop为此使用的内存量？最佳答案 Hadoop运行多个Java实例的原因是因为Hadoop有各种守护进程，如namenode、secondarynamenode、datanode、jobtracker、tasktracker执行各种任务，每个守护进程都是一个Java进程。我不确定HDInsight，但在ApacheHadoop中，您可以通过在通常

HDinsight hadoop section code hive azure-hdinsight azul-zulu

hadoop - 我们可以有任何命令来检查名称节点元数据吗

我是Hadoop的新手，有一个问题，例如，我们可以使用任何命令来检查表格格式的名称节点元数据吗？比如如果我想检查namenode在FsImage中保存数据的具体格式。如果我在调查中遗漏了一些特定的命令，请帮助我。感谢和问候最佳答案 Hadoopofflineimageviewer会做的。语法:hdfsoiv-ipath/to/fsimage/file-odestination/file通过使用它，我们可以将名称节点日志转换为文本和xml文件。关于hadoop-我们可以有任何命令来检查

hadoop 我们 section strong hadoop2

performance - Hive 查询卡在执行中间

同事们，我在配置单元中使用sql脚本执行bash文件时遇到问题-它总是卡在同一个地方map=100%，reduce=67%我尝试使用具有不同变体和其他调整特性的映射器和缩减器数量:SEThive.exec.parallel=true;SEThive.default.fileformat=RCFILE;SEThive.stats.autogather=false;SEThive.exec.compress.output=true;SETmapred.output.compression.codec=org.apache.hadoop.io.compress.SnappyCodec;SET

查询卡 performance section 配置单 hive hadoop

mysql - Apache Sqoop 连接错误

尝试使用sqoop从mysql数据库中列出数据库时出现以下错误。我正在使用ClouderaVMCDH4，如果它没有默认预安装MySql。我按照cloudera教程安装了MySql。现在我试图从MySQl中列出数据库，但它失败了。是否存在任何jdbc连接问题？[cloudera@localhost~]$sqooplist-databases--connect"jdbc:mysql://localhost.localdomain"--userroot--passwordaaaaaaaaWarning:/usr/lib/sqoop/../accumulodoesnotexist!Accumu

Apache mysql password section specify hadoop jdbc bigdata sqoop

124 125 126127128 129 130