$Spark

java - 在 map 调用中获取 Spark 上的行

我尝试从HDFS中的文件聚合数据。我需要从那些对hbase中的特定表具有值(value)的数据中添加一些详细信息。但我有异常(exception):org.apache.spark.SparkException:Tasknotserializableatorg.apache.spark.util.ClosureCleaner$.ensureSerializable(ClosureCleaner.scala:166)atorg.apache.spark.util.ClosureCleaner$.clean(ClosureCleaner.scala:158)atorg.apache.spa

hadoop - 在正在运行的 spark/hadoop 集群中添加一个 hdfs datanode

我有一个带有1个主节点和2个节点(工作节点+数据节点)的spark集群。我想添加另一个数据节点。问题是，当我执行hdfsdfs-setrep-R-w2时，结果是:1stdatanode->DFSUsed%:75.61%2nddatanode->DFSUsed%:66.78%3rddatanode->DFSUsed%:8.83%您知道如何平衡hdfs中的block，以便每个block大约为30->33%吗？谢谢最佳答案运行balancer，集群平衡实用程序。这将重新平衡数据节点之间的数据。hdfsbalancer-threshol

hadoop datanode section code apache-spark hdfs

json - spark.RDD take(n) 返回元素n的数组，n次

我正在使用来自https://github.com/alexholmes/json-mapreduce的代码将多行json文件读入RDD。vardata=sc.newAPIHadoopFile(filepath,classOf[MultiLineJsonInputFormat],classOf[LongWritable],classOf[Text],conf)我打印出前n个元素来检查它是否正常工作。data.take(n).foreach{p=>val(line,json)=pprintlnprintln(newJSONObject(json.toString).toString(4)

spark json code pre section scala hadoop apache-spark

hadoop - MapReduce 在哪些类型的用例中优于 Spark？

我刚刚参加了一个关于Spark的入门类(class)，并询问演讲者Spark是否可以完全替代MapReduce，并被告知Spark可以在任何用例中替代MapReduce，但在某些特定用例中，MapReduce实际上更快比Spark。MapReduce可以比Spark更快解决的用例有哪些特点？最佳答案请原谅我quotingmyselffromQuora，但是:对于MapReduce设计的数据并行、一次性、类似ETL的作业，MapReduce比Spark等价物更轻量级Spark相当成熟，YARN现在也是如此，但Spark-on-YA

优于 MapReduce Spark section hadoop apache-spark

batch-file - Apache Spark : batch processing of files

我在HDFS上设置了目录和子目录，我想在将所有文件一次加载到内存中之前预处理所有文件。我基本上有大文件(1MB)，一旦处理将更像1KB，然后执行sc.wholeTextFiles开始我的分析我如何在我的目录/子目录中的每个文件(*.xml)上循环，执行一个操作(假设为了示例的缘故，保留第一行)，然后转储结果回到HDFS(新文件，比如.xmlr)？最佳答案我建议您只使用sc.wholeTextFiles并使用转换对其进行预处理，然后将它们全部保存为单个压缩序列文件(您可以引用我的指南:http://0x0fff.com/spark

batch batch-file section code 子目 hadoop apache-spark hdfs

Spark---RDD算子(单值类型Value)

文章目录1.RDD算子介绍2.转换算子2.1Value类型2.1.1map2.1.2mapPartitions2.1.3mapPartitionsWithIndex2.1.4flatMap2.1.5glom2.1.6groupBy2.1.7filter2.1.8sample2.1.9distinct2.1.10coalesce2.1.11repartition2.1.12sortBy1.RDD算子介绍RDD算子是用于对RDD进行转换（Transformation）或行动（Action）操作的方法或函数。通俗来讲，RDD算子就是RDD中的函数或者方法，根据其功能，RDD算子可以分为两大类：转换算

算子类型 xff0c xff xff0 spark javascript 服务器

scala - Spark-Scala HBase 表创建失败(MetaException(消息 :file:/user/hive/warehouse/src is not a directory or unable to create one)

我的VM中运行着hortonworks沙盒。我已经完成了所有的hive-site.xml配置并放置在Spark/conf文件中。我可以使用PySpark访问HBase并创建/更新表，但是当我在Scala中执行相同的实现时，会出现以下错误:FAILED:ExecutionError,returncode1fromorg.apache.hadoop.hive.ql.exec.DDLTask.MetaException(message:file:/user/hive/warehouse/srcisnotadirectoryorunabletocreateone)我也更改了对“hive/war

MetaException Spark-Scala strong section hive scala hadoop hbase apache-spark pyspark

hadoop - 是否可以使用 spark 的 jdbc 驱动程序将 apache spark 与 jasper 集成？

我们想使用apachespark进行实时分析？我们目前使用hive/MR进行数据处理，使用mysqlsql存储聚合结果，使用jasper报告进行分析？由于mysql的可伸缩性问题，这种方法远非理想。我们正在探索apachespark在hdfs或cassandra之上运行，唯一的问题是是否有办法让spark与jasper服务器集成？如果不是，还有哪些其他UI选项可以与spark一起使用？最佳答案我找到了共享的答案和想法，如果你将hivemetastore与spark一起使用，你可以将RDD持久化为hive表，一旦你这样做了，任何使

spark 驱动 section hive hadoop jasper-reports apache-spark spark-streaming

hadoop - Apache Spark 在工作开始前做什么

我有一个在AWSEMR上连续运行的ApacheSpark批处理作业。它从AWSS3中提取数据，使用该数据运行几个作业，然后将数据存储在RDS实例中。但是，作业之间似乎有很长一段时间没有事件。这是CPU使用情况:这是网络:注意每列之间的间隙，它几乎与事件列的大小相同!起初我以为这两列发生了移动(当它从S3中提取时，它没有使用大量CPU，反之亦然)但后来我注意到这两个图表实际上是相互跟随的。这是有道理的，因为RDD是惰性的，因此会在作业运行时拉动。这引出了我的问题，那段时间Spark在做什么？在那段时间里，所有的Ganglia图表似乎都归零了。就好像集群决定在每个作业之前休息一下。谢谢。编

hadoop Apache code INFO executor amazon-web-services amazon-s3 apache-spark emr

java - spark map 方法抛出序列化异常

我是Spark的新手，我在map函数中遇到序列化问题。这是代码的一些元素privateFunctionSparkMap()throwsIOException{returnnewFunction(){publicStringcall(Rowrow)throwsIOException{/*somecode*/}};}publicstaticvoidmain(String[]args)throwsException{MyClassmyClass=newMyClass();SQLContextsqlContext=newSQLContext(sc);DataFramedf=sqlContext

spark java code MyClass myPackage hadoop serialization apache-spark

64 65 666768 69 70