Hdfs

hadoop - s3n/s3a如何管理文件？

我一直在使用KafkaConnect和Secor等服务将Parquet文件保存到S3。我对HDFS或Hadoop不是很熟悉，但似乎这些服务通常会在批量写入s3之前将临时文件写入本地内存或磁盘。s3n/s3a文件系统是在本地虚拟化HDFS样式的文件系统，然后按配置的时间间隔推送，还是在写入s3n/s3a和写入s3之间存在一对一的对应关系？我不确定我在这里问的问题是否正确。任何指导将不胜感激。最佳答案 S3A/S3N只是针对远程对象存储实现Hadoop文件系统API，包括假装它具有您可以重命名和删除的目录。它们历来保存您写入本地磁盘的

管理文件 hadoop section s3 code amazon-s3 hdfs apache-kafka

hadoop - 权威指南 - 为什么 hdfs 中的 block 这么大

我从权威指南(HDFS概念-block)中看到了以下段落，但无法理解。MapReduce中的映射任务通常一次在一个block上运行，因此如果您的任务太少(少于集群中的节点)，您的作业将比其他方式运行得更慢。我想知道与集群中的节点总数相比，当任务很少时，作业会如何变慢。假设集群中有1000个节点和3个任务(按任务我取block，因为每个block被发送到一个节点用于单个任务)，获得结果所花费的时间总是少于说1000的场景节点和1000个任务对吗？权威指南中给出的段落无法说服我。最佳答案您从书中引用的段落基本上是说“尽可能多地利用节

权威指南 section 1000 block hadoop mapreduce

hadoop - 使用 OOZIE 在文件到达 NFS 时触发执行的最佳方法

正在关注1和2:不时有不同类型的文件进入我的NFS目录。我想使用OOZIE或任何其他HDFS解决方案来触发文件到达事件，并根据文件类型将文件复制到HDFS的特定位置。最好的方法是什么？最佳答案最佳方式是非常主观的术语。这在很大程度上取决于数据的类型、频率以及数据到达特定位置后应该发生什么样的事情。Apacheflume可以监控特定文件夹的数据可用性，并将其向下推送到任何接收器，例如HDFS原样。Flume非常适合流式传输数据。但它只做一项特定工作-只是将数据从一个地方移动到另一个地方。但另一方面，请查看Oozie协调器。协调器具

hadoop OOZIE section 协调器 questions hdfs nfs

hadoop - 尝试执行 pig 语句时出错

我正在尝试执行一条pig语句，该语句向我显示txt文件中的数据，并且我在mapreduce模式下运行，但是我收到一个错误，请有人帮我解决这个问题!![root@master~]#pig-xmapreduce17/04/1917:42:34INFOpig.ExecTypeProvider:TryingExecType:LOCAL17/04/1917:42:34INFOpig.ExecTypeProvider:TryingExecType:MAPREDUCE17/04/1917:42:34INFOpig.ExecTypeProvider:PickedMAPREDUCEastheExecTy

时出 hadoop apache org mapreduce hdfs apache-pig

scala - 使用 Spark 在 HDFS 上压缩 Har 文件

我有大量的hadoop存档.har格式的数据。因为har不包含任何压缩，所以我试图进一步将其压缩并存储在HDFS中。我唯一可以毫无错误地开始工作的是:harFile.coalesce(1,"true").saveAsTextFile("hdfs://namenode/archive/GzipOutput",classOf[org.apache.hadoop.io.compress.GzipCodec])//`coalesce`becauseGzipisn'tsplittable.但是，这并没有给我正确的结果。生成了一个Gzipped文件，但输出无效(单行说明rdd类型等)任何帮助将不胜

scala Spark 34 hadoop apache apache-spark compression hdfs

hadoop - Hive 分区/分桶表的实际结构是什么？

我无法在虚拟框中配置多数据节点集群不考虑复制因子取1。假设我有一个10GB的文件和一个具有2个不同值的列城市，并且我有2个数据节点。想按城市划分数据。我还将在每个分区的2个桶中存储邮政编码。我的问题是每个分区是否会出现在每个数据节点中，或者每个节点将只有不同的分区。我的理解是每个节点都有所有分区，但在某些节点中，由于数据文件中的值不足，分区可能不存在。每个数据节点中的每个分区都将按邮政编码分桶，并且某些分桶可能没有值。最佳答案分区是使用目录实现的。目录包含文件。可能是一个，也可能是很多。桶是使用文件实现的。一个桶可能与一个文件相

hadoop Hive section 点中 stackoverflow hdfs

hadoop - Hadoop 中的副本在 NameNode 上所需的内存

在thisCloudera博文，在Replication部分，已经解释了复制不会消耗NameNode上的内存。但是，我对此持怀疑态度，因为我知道NameNode在主内存中存储有关每个文件及其副本的信息。那么，无论有无复制，内存需求如何相同？最佳答案那么内存消耗取决于你的意思，因为有物理内存和虚拟内存(我这里只说Namenode)就物理内存而言，Cloudera博客是正确的，因为Datanode有责任与Namenode通信(例如，在重启后连接时)它维护的block。Namenode仅将文件系统结构存储到磁盘(fsimage和编辑文

NameNode hadoop code strong section hdfs

hadoop - Spark 数据集写入 HDFS 期间创建的空分区

尝试使用write方法将数据集/数据帧作为Parquet保存到hdfs。分区在HDFS中创建，但数据为空。我正在使用Spark版本-2.xdataset.write.mode("append").partitionBy("empNo").format("parquet").save("hdfspath")或dataset.write.mode(SaveMode.Overwrite).save("hdfspath")请推荐最佳答案我刚刚检查了它的数据框。根据您的查询将其分区在单个列上。在具有适当值的输出文件夹中创建了两个分区文件夹

空分 hadoop section code 34 apache-spark hdfs

macos - Hadoop2.7.3 : Cannot see DataNode/ResourceManager process after starting hdfs and yarn

我使用的是mac和java版本:$java-versionjavaversion"1.8.0_111"Java(TM)SERuntimeEnvironment(build1.8.0_111-b14)JavaHotSpot(TM)64-BitServerVM(build25.111-b14,mixedmode)点击此链接:https://dtflaneur.wordpress.com/2015/10/02/installing-hadoop-on-mac-osx-el-capitan/我先brewinstallhadoop，根据需要配置ssh连接和xml文件，start-dfs.shst

ResourceManager DataNode hadoop localhost code macos process hdfs hadoop-yarn

用于获取用于 hadoop 中各个节点的 dfs 的 Rest Api

是否有任何restAPI或Hadoop指标来获取用于单个节点的dfs。目前，我通过手动执行以下命令获取用于单个节点的dfshdfsdfsadmin-report 最佳答案它不是RESTAPI，但您应该能够使用NameNode的JMX接口(interface)来提取此信息。http://NAMENODE:DFSPORT/jmx?qry=Hadoop:service=NameNode,name=NameNodeInfo这包含与以下相同的信息:hdfsdfsadmin-report同时发布于:http://NAMENODE:DFSPOR

hadoop Rest section code pre hdfs

10 11 121314 15 16