hdfs_rtp

hadoop - 为什么 Spark 选择在 shuffle 阶段通过网络发送数据而不是写入 HDFS 上的某个位置？

据我所知，spark尝试通过网络将数据发送到另一个节点的内存缓冲区，如果它不适合内存则溢出到磁盘，为什么spark不能从任何节点可以写入的地方写入HDFS读？最佳答案将其写入磁盘的传输速度要慢得多。最重要的是，您保证会产生在感兴趣的节点之间同步磁盘访问的开销。关于hadoop-为什么Spark选择在shuffle阶段通过网络发送数据而不是写入HDFS上的某个位置？，我们在StackOverflow上找到一个类似的问题： https://stackover

hadoop - MrJob 花费大量时间 Copy local files into hdfs

我遇到的问题是:已经将我的input.txt(50MBytes)文件放入HDFS，我正在运行python./test.pyhdfs:///user/myself/input.txt-rhadoop--hadoop-bin/usr/bin/hadoopMrJob似乎花了很多时间将文件复制到hdfs(又是？)Copyinglocalfilesintohdfs:///user/myself/tmp/mrjob/test.myself.20150927.104821.148929/files/这符合逻辑吗？它不应该直接从HDFS使用input.txt吗？(使用Hadoop版本2.6.0)

hadoop MrJob code section myself hdfs

hadoop - Cloudera Manager - HDFS 可用空间健康问题故障排除

我有一个由两台主机配置的集群-我正在运行的作业似乎正在创建大量日志，并且我的一个hdfs数据节点显示严重的健康问题为-四件事:如何清理这些日志并腾出空间？从/var/log/hadoop-hdfs手动删除它们是个好主意吗？如上/var/log/hadoop-hdfs目录只有610MBhdfs的空间在哪里被占用？如何配置日志文件以定期删除？我有HDFS、Spark和YARN-MR2服务已启动并正在运行，它们都在创建自己的日志。我也想清理那些。谢谢! 最佳答案深入研究hdfs之后-要获取哪个目录的大小，请执行:hadoopfs-du-

Cloudera Manager section hadoop strong apache-spark hdfs hadoop-yarn spark-graphx

java - 在启用权限的情况下在 hdfs 上写入文件

我尝试在启用权限的情况下使用Java(v1.8)在hdfs上写入文件。作为hadoop实例，我使用了现成的docker镜像:https://hub.docker.com/r/sequenceiq/hadoop-docker/我关注了WriteafileinhdfswithJava执行如下操作:Configurationconfiguration=newConfiguration();configuration.set("fs.defaultFS","hdfs://127.0.0.1:9000/user/root");configuration.set("hadoop.job.ugi",

java hdfs hadoop apache

hadoop - apache pig 没有连接到 hdfs

我有Hadoop版本2.6.3和pig-0.6.0我在单节点集群中启动并运行了所有守护进程。发射pig命令后。pig只连接到file:///而不是hdfs你能告诉我如何连接hdfs吗下面是我能看到的INFO日志2016-01-1020:58:30,431[main]INFOorg.apache.pig.backend.hadoop.executionengine.HExecutionEngine-Connectingtohadoopfilesystemat:file:///2016-01-1020:58:30,650[main]INFOorg.apache.hadoop.metrics

hadoop apache java mapreduce apache-pig hadoop2

java - 是否可以使用java将数据附加到hdfs

我在hdfs中有一个制表符分隔的文件。我需要使用Java将用户输入附加到hdfs中的分隔文件。我不知道如何实现这个。如果有人告诉我其中的逻辑，那将对我非常有用。最佳答案 org.apache.hadoop.dfs.DistributedFileSystem类有一个方法append，它返回一个流对象FSDataOutputStream，您可以在其中写入使用out.write。这将使您的工作完成。在此处引用文档http://archive.cloudera.com/cdh/2/hadoop-0.18.3+76.2/api/org/ap

java hdfs hadoop section apache

json - 有没有一种直接的方法可以将存储在 HDFS 中的数据转换为 JSON？

json HDFS Value section code hadoop apache-pig avro

java - Hadoop HDFS文件拆分成 block 的哪个Java文件

众所周知，当一个文本文件从本地复制到HDFS时，该文件被分割成固定大小的128MB。例如，当我将一个256MB的文本文件复制到HDFS时，将有2个block(256/128)包含“拆分”文件。谁能告诉我Hadoop2.7.1源代码中的哪个java/jar文件具有将文件拆分为block的功能，以及哪个java/jar文件将block写入数据节点的目录.帮我追踪这段代码。我只找到了在FileInputFormat.java中找到的对block进行逻辑输入拆分的那个，这不是我需要的。我需要用于拆分物理文件的java文件。最佳答案将数据

Hadoop block code pre java apache hdfs

hadoop - "Content-type"用于使用 Web HDFS REST 客户端上传 jars 文件

我正在使用WebHDFSREST客户端，我可以上传.xml和.q文件。代码的有用部分-CloseableHttpClienthttpclient=HttpClients.createDefault();HttpPuthttpPut=newHttpPut(urlString);httpPut.setHeader("Accept","application/xml");httpPut.setHeader("Content-type","application/xml");CloseableHttpResponseresponse=httpclient.execute(httpPut);我在

Content-type amp code section httpPut hadoop httpclient apache-httpclient-4.x webhdfs

java - RDD 的最后一项未保存到 HDFS

我是Spark的新手，目前正在做一些在4个Sparkworker上运行的基本ETL，从外部源读取项目，然后将它们保存到HDFS。奇怪的是，我的HDFS结果中缺少项目。因为我需要遵循某些文件系统约定，所以我想将项目拆分到单独的存储桶中并将它们保存在单独的子文件夹中(我知道我在这里降低了性能):Listsources;//somelistofstringsJavaRDDtaskList;//alotoftasksforeachsourceJavaRDDitems=taskList.map(task->newExtractor().execute(task));for(Stringsourc

java HDFS code section sources hadoop apache-spark hadoop-yarn

153 154 155156157 158 159