apache-spark - Apache Zeppelin + Spark 的按需用户集群？

coder 2024-01-06 原文

我们使用 cloudera 来部署一个 zeppelin-spark-yarn-hdfs 集群。现在，只有一个 zeppelin 和 spark 实例，所有 spark notebook 的执行都会影响到每个用户。例如，如果我们停止用户笔记本中的 spark 上下文，它会影响所有其他用户的笔记本。我已经看到 zeppelin 中有一个选项可以隔离解释器，但是有没有办法根据需要为每个用户提供自己的“集群”？也许使用 Docker 并使用 zeppelin 和 spark 为每个用户构建一个图像，并将他们的资源限制为用户集群提供的资源？我完全不知道如何实现它，或者它是否可能，但我的理想场景是像数据 block 那样的方法。在那里你可以拥有自己的集群，所有资源都与其他用户隔离。

最佳答案

有几种方法可以解决。

我假设您无论如何都在运行集群，因此任何按需资源都仅限于静态资源，但由 YARN 以动态方式分配。您应该首先查看 YARN 队列和 YARN 授权。通过这种方式，您可以根据组织的公平标准有效地管理资源可用性。

在 Zeppelin 端，确保还启用身份验证 - 这会传递到 YARN 和 HDFS。有效隔离用户。如果您有不同的要求，并希望确保口译员不会发生冲突，您可以

使用隔离模式。这最容易设置，但维护起来很棘手。
为每个团队/组织单位设置一名口译员。这会产生少量开销，并且您可以在一个 Zeppelin 实例中管理所有 OU，但这可能是集中管理不同需求的最佳方式。
使用可部署的 Zeppelin(例如 Dockerized)将 OU 彼此隔离，但您还必须维护每个 OU 的配置并在部署时将它们注入(inject)到镜像中，或者管理一大堆自定义镜像
只需让 OU 管理他们自己的 Zeppelin，并使用集群访问权限来限制他们在集群端实际可以做的事情。由于没有“一般”Zeppelin 用户，此建议取决于用户的技术技巧。维护它应该不会太困难，而且灵 active 可能使它值得。显然，预计会有更高的支持/协助工作量。

哪种解决方案最适合您，在很大程度上取决于组织构成、技术技能和用户的各种要求。要记住的一件事是依赖管理——一旦集群访问得到解决，这可能是最大的问题。一旦越来越多的人开始使用 Zeppelin 并共享同一个解释器设置，你就越有可能遇到依赖冲突，这会毁了每个人的一天。我个人会推荐我的第二个和第四个建议，但我看到第三个建议也在大型企业中使用——如果多样性不是太高，它就可以工作。

我不会做的一件事是为每个用户 创建一个 Zeppelin 实例。 Zeppelin 主要用于共享信息，因此 Zeppelin 的一个实例应该在希望从彼此的工作中受益的一组用户之间共享。我认为您可以使用网络安装的笔记本目录来重新合并笔记本，但可能会出现写入争用问题，即意外覆盖/恢复以前的写入。

关于apache-spark - Apache Zeppelin + Spark 的按需用户集群？，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/45583607/

需用 apache-spark Zeppelin section spark hadoop hadoop-yarn cloudera apache-zeppelin

有关apache-spark - Apache Zeppelin + Spark 的按需用户集群？的更多相关文章

ruby-on-rails - 如何优雅地重启 thin + nginx？ - 2
我的瘦服务器配置了nginx，我的ROR应用程序正在它们上运行。在我发布代码更新时运行thinrestart会给我的应用程序带来一些停机时间。我试图弄清楚如何优雅地重启正在运行的Thin实例，但找不到好的解决方案。有没有人能做到这一点？最佳答案 #Restartjustthethinserverdescribedbythatconfigsudothin-C/etc/thin/mysite.ymlrestartNginx将继续运行并代理请求。如果您将Nginx设置为使用多个上游服务器，例如server{listen80;server
叮咚买菜基于 Apache Doris 统一 OLAP 引擎的应用实践 - 2
导读：随着叮咚买菜业务的发展，不同的业务场景对数据分析提出了不同的需求，他们希望引入一款实时OLAP数据库，构建一个灵活的多维实时查询和分析的平台，统一数据的接入和查询方案，解决各业务线对数据高效实时查询和精细化运营的需求。经过调研选型，最终引入ApacheDoris作为最终的OLAP分析引擎，Doris作为核心的OLAP引擎支持复杂地分析操作、提供多维的数据视图，在叮咚买菜数十个业务场景中广泛应用。作者｜叮咚买菜资深数据工程师韩青叮咚买菜创立于2017年5月，是一家专注美好食物的创业公司。叮咚买菜专注吃的事业，为满足更多人“想吃什么”而努力，通过美好食材的供应、美好滋味的开发以及美食品牌的孵
ruby - 使用 `+=` 和 `send` 方法 - 2
如何将send与+=一起使用？a=20;a.send"+=",10undefinedmethod`+='for20:Fixnuma=20;a+=10=>30 最佳答案恐怕你不能。+=不是方法，而是语法糖。参见http://www.ruby-doc.org/docs/ProgrammingRuby/html/tut_expressions.html它说Incommonwithmanyotherlanguages,Rubyhasasyntacticshortcut:a=a+2maybewrittenasa+=2.你能做的最好的事情是:
ruby - 如何计算 Liquid 中的变量 +1 - 2
我对如何计算通过{%assignvar=0%}赋值的变量加一完全感到困惑。这应该是最简单的任务。到目前为止，这是我尝试过的:{%assignamount=0%}{%forvariantinproduct.variants%}{%assignamount=amount+1%}{%endfor%}Amount:{{amount}}结果总是0。也许我忽略了一些明显的东西。也许有更好的方法。我想要存档的只是获取运行的迭代次数。最佳答案因为{{incrementamount}}将输出您的变量值并且不会影响{%assign%}定义的变量，我
arrays - Ruby 数组 += vs 推送 - 2
我有一个数组数组，想将元素附加到子数组。+=做我想做的，但我想了解为什么push不做。我期望的行为(并与+=一起工作):b=Array.new(3,[])b[0]+=["apple"]b[1]+=["orange"]b[2]+=["frog"]b=>[["苹果"],["橙子"],["Frog"]]通过推送，我将推送的元素附加到每个子数组(为什么？):a=Array.new(3,[])a[0].push("apple")a[1].push("orange")a[2].push("frog")a=>[[“苹果”、“橙子”、“Frog”]、[“苹果”、“橙子”、“Frog”]、[“苹果”、“
+= 的 Ruby 方法 - 2
有没有办法让Ruby能够做这样的事情？classPlane@moved=0@x=0defx+=(v)#thisiserror@x+=v@moved+=1enddefto_s"moved#{@moved}times,currentxis#{@x}"endendplane=Plane.newplane.x+=5plane.x+=10putsplane.to_s#moved2times,currentxis15 最佳答案您不能在Ruby中覆盖复合赋值运算符。任务在内部处理。您应该覆盖+，而不是+=。plane.a+=b与plane.a=
ruby - Sinatra + Heroku + Datamapper 使用 dm-sqlite-adapter 部署问题 - 2
出于某种原因，heroku尝试要求dm-sqlite-adapter，即使它应该在这里使用Postgres。请注意，这发生在我打开任何URL时-而不是在gitpush本身期间。我构建了一个默认的Facebook应用程序。gem文件:source:gemcuttergem"foreman"gem"sinatra"gem"mogli"gem"json"gem"httparty"gem"thin"gem"data_mapper"gem"heroku"group:productiondogem"pg"gem"dm-postgres-adapter"endgroup:development,:t
ruby - Ruby 中字符串运算符 + 和 << 的区别 - 2
我是Ruby和这个网站的新手。下面两个函数是不同的，一个在函数外修改变量，一个不修改。defm1(x)x我想确保我理解正确-当调用m1时，对str的引用被复制并传递给将其视为x的函数。运算符当调用m2时，对str的引用被复制并传递给将其视为x的函数。运算符+创建一个新字符串，赋值x=x+"4"只是将x重定向到新字符串，而原始str变量保持不变。对吧？谢谢最佳答案 String#+::str+other_str→new_strConcatenation—ReturnsanewStringcontainingother_strconc
ruby - rails 3.2.2(或 3.2.1)+ Postgresql 9.1.3 + Ubuntu 11.10 连接错误 - 2
我正在使用PostgreSQL9.1.3(x86_64-pc-linux-gnu上的PostgreSQL9.1.3，由gcc-4.6.real(Ubuntu/Linaro4.6.1-9ubuntu3)4.6.1，64位编译)和在ubuntu11.10上运行3.2.2或3.2.1。现在，我可以使用以下命令连接PostgreSQLsupostgres输入密码我可以看到postgres=#我将以下详细信息放在我的config/database.yml中并执行“railsdb”，它工作正常。开发:adapter:postgresqlencoding:utf8reconnect:falsedat
ruby - 在 Ruby + Chef 中检查现有目录失败 - 2
这是我在ChefRecipe中的一blockRuby:#ifdatadirdoesn'texist,moveoverthedefaultoneif!File.exist?("/vol/postgres/data")execute"mv/var/lib/postgresql/9.1/main/vol/postgres/data"end结果是:Executingmv/var/lib/postgresql/9.1/main/vol/postgres/datamv:inter-devicemovefailed:`/var/lib/postgresql/9.1/main'to`/vol/post

apache-spark - Apache Zeppelin + Spark 的按需用户集群？

有关apache-spark - Apache Zeppelin + Spark 的按需用户集群？的更多相关文章

随机推荐