hadoop - 为什么HDFS客户端会将文件数据缓存到一个临时的本地文件中？

coder 2024-01-06 原文

为什么HDFS客户端不能直接发送到DataNode？

HDFS客户端缓存有什么优势？

创建文件的应用程序请求不会立即到达 NameNode。
事实上，HDFS 客户端最初会将文件数据缓存到一个临时的本地文件中。
应用程序写入透明地重定向到这个临时本地文件。
当本地文件积累了至少一个 HDFS block 大小的数据时，客户端联系 NameNode 创建一个文件。
NameNode 然后按照创建部分中的描述继续进行。客户端将数据 block 从本地临时文件刷新到指定的DataNodes。
当文件关闭时，临时本地文件中剩余的未刷新数据将传输到DataNode。
然后客户端告诉NameNode文件已经关闭。
此时，NameNode 将文件创建操作提交到持久存储中。如果 NameNode 在文件关闭之前死亡，则文件丢失。

最佳答案

听起来您正在引用 Apache Hadoop HDFS Architecture文档，特别是标题为 Staging 的部分.遗憾的是，此信息已过时，不再是对当前 HDFS 行为的准确描述。

相反，客户端立即向 NameNode 发出一个 create RPC 调用。 NameNode 在其元数据中跟踪新文件，并回复一组可以接收 block 数据写入的候选 DateNode 地址。然后，客户端开始向文件写入数据。当客户端写入数据时，它正在写入到 DataNode 的套接字连接上。如果写入的数据变得大到超过 block 大小边界，那么客户端将再次与 NameNode 交互以进行 addBlock RPC 在 NameNode 元数据中分配一个新 block 并获得一组新的候选 DataNode位置。客户端写入本地临时文件是没有意义的。

但是请注意，替代文件系统(例如与 Amazon S3 集成的 S3AFileSystem)可能支持缓冲到磁盘的选项。 (如果您对此有兴趣，请参阅 Integration with Amazon Web Services 的 Apache Hadoop 文档。)

我已经提交了 Apache JIRA HDFS-11995跟踪更正文档。

关于hadoop - 为什么HDFS客户端会将文件数据缓存到一个临时的本地文件中？，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/44606691/

有关hadoop - 为什么HDFS客户端会将文件数据缓存到一个临时的本地文件中？的更多相关文章

ruby - 使用 RubyZip 生成 ZIP 文件时设置压缩级别 - 2
我有一个Ruby程序，它使用rubyzip压缩XML文件的目录树。gem。我的问题是文件开始变得很重，我想提高压缩级别，因为压缩时间不是问题。我在rubyzipdocumentation中找不到一种为创建的ZIP文件指定压缩级别的方法。有人知道如何更改此设置吗？是否有另一个允许指定压缩级别的Ruby库？最佳答案这是我通过查看rubyzip内部创建的代码。level=Zlib::BEST_COMPRESSIONZip::ZipOutputStream.open(zip_file)do|zip|Dir.glob("**/*")d
ruby - 为什么我可以在 Ruby 中使用 Object#send 访问私有(private)/ protected 方法？ - 2
类classAprivatedeffooputs:fooendpublicdefbarputs:barendprivatedefzimputs:zimendprotecteddefdibputs:dibendendA的实例a=A.new测试a.foorescueputs:faila.barrescueputs:faila.zimrescueputs:faila.dibrescueputs:faila.gazrescueputs:fail测试输出failbarfailfailfail.发送测试[:foo,:bar,:zim,:dib,:gaz].each{|m|a.send(m)resc
ruby - 其他文件中的 Rake 任务 - 2
我试图在一个项目中使用rake，如果我把所有东西都放到Rakefile中，它会很大并且很难读取/找到东西，所以我试着将每个命名空间放在lib/rake中它自己的文件中，我添加了这个到我的rake文件的顶部:Dir['#{File.dirname(__FILE__)}/lib/rake/*.rake'].map{|f|requiref}它加载文件没问题，但没有任务。我现在只有一个.rake文件作为测试，名为“servers.rake”，它看起来像这样:namespace:serverdotask:testdoputs"test"endend所以当我运行rakeserver:testid时
ruby-on-rails - 在 Rails 中将文件大小字符串转换为等效千字节 - 2
我的目标是转换表单输入，例如“100兆字节”或“1GB”，并将其转换为我可以存储在数据库中的文件大小(以千字节为单位)。目前，我有这个:defquota_convert@regex=/([0-9]+)(.*)s/@sizes=%w{kilobytemegabytegigabyte}m=self.quota.match(@regex)if@sizes.include?m[2]eval("self.quota=#{m[1]}.#{m[2]}")endend这有效，但前提是输入是倍数(“gigabytes”，而不是“gigabyte”)并且由于使用了eval看起来疯狂不安全。所以，功能正常，
ruby-on-rails - Rails 3 中的多个路由文件 - 2
Rails2.3可以选择随时使用RouteSet#add_configuration_file添加更多路由。是否可以在Rails3项目中做同样的事情？最佳答案在config/application.rb中:config.paths.config.routes在Rails3.2(也可能是Rails3.1)中，使用:config.paths["config/routes"] 关于ruby-on-rails-Rails3中的多个路由文件，我们在StackOverflow上找到一个类似的问题
ruby-on-rails - Rails - 子类化模型的设计模式是什么？ - 2
我有一个模型:classItem项目有一个属性“商店”基于存储的值，我希望Item对象对特定方法具有不同的行为。Rails中是否有针对此的通用设计模式？如果方法中没有大的if-else语句，这是如何干净利落地完成的？最佳答案通常通过Single-TableInheritance. 关于ruby-on-rails-Rails-子类化模型的设计模式是什么？，我们在StackOverflow上找到一个类似的问题： https://stackoverflow.co
ruby - 将差异补丁应用于字符串/文件 - 2
对于具有离线功能的智能手机应用程序，我正在为Xml文件创建单向文本同步。我希望我的服务器将增量/差异(例如GNU差异补丁)发送到目标设备。这是计划:Time=0Server:hasversion_1ofXmlfile(~800kiB)Client:hasversion_1ofXmlfile(~800kiB)Time=1Server:hasversion_1andversion_2ofXmlfile(each~800kiB)computesdeltaoftheseversions(=patch)(~10kiB)sendspatchtoClient(~10kiBtransferred)Cl
ruby - 如何将脚本文件的末尾读取为数据文件(Perl 或任何其他语言) - 2
我正在寻找执行以下操作的正确语法(在Perl、Shell或Ruby中):#variabletoaccessthedatalinesappendedasafileEND_OF_SCRIPT_MARKERrawdatastartshereanditcontinues. 最佳答案 Perl用__DATA__做这个:#!/usr/bin/perlusestrict;usewarnings;while(){print;}__DATA__Texttoprintgoeshere 关于ruby-如何将脚
ruby - 什么是填充的 Base64 编码字符串以及如何在 ruby 中生成它们？ - 2
我正在使用的第三方API的文档状态:"[O]urAPIonlyacceptspaddedBase64encodedstrings."什么是“填充的Base64编码字符串”以及如何在Ruby中生成它们。下面的代码是我第一次尝试创建转换为Base64的JSON格式数据。xa=Base64.encode64(a.to_json) 最佳答案他们说的padding其实就是Base64本身的一部分。它是末尾的“=”和“==”。Base64将3个字节的数据包编码为4个编码字符。所以如果你的输入数据有长度n和n%3=1=>"=="末尾用于填充n%
ruby - 解析 RDFa、微数据等的最佳方式是什么，使用统一的模式/词汇(例如 schema.org)存储和显示信息 - 2
我主要使用Ruby来执行此操作，但到目前为止我的攻击计划如下:使用gemsrdf、rdf-rdfa和rdf-microdata或mida来解析给定任何URI的数据。我认为最好映射到像schema.org这样的统一模式，例如使用这个yaml文件，它试图描述数据词汇表和opengraph到schema.org之间的转换:#SchemaXtoschema.orgconversion#data-vocabularyDV:name:namestreet-address:streetAddressregion:addressRegionlocality:addressLocalityphoto:i

hadoop - 为什么HDFS客户端会将文件数据缓存到一个临时的本地文件中？

有关hadoop - 为什么HDFS客户端会将文件数据缓存到一个临时的本地文件中？的更多相关文章

随机推荐