草庐IT

mongodb - 动态模式的 Hive 表创建

coder 2024-01-07 原文

我们正在研究 Hive 是否允许我们运行一些类似 SQL 的查询 mongo 风格的动态模式作为我们 map-reduce 作业的先驱。

数据以几个 TiB 的 BSON 文件的形式出现;每个文件包含 JSON“样本”。示例示例如下:

{
    "_id" : "SomeGUID",
    "SomeScanner" : 
    {
        "B64LR" : 22,
        "Version" : 192565886128245
        },
        "Parser" : 
        {
            "Size" : 73728,
            "Headers" : 
            [
                {
                    "VAddr" : 4096,
                    "VSize" : 7924.                  
. . . etc. . . .

作为动态模式,只有少数字段保证存在。

我们希望能够针对可能是某物的输入集运行查询 喜欢

SomeScanner.Parser.Headers.VSize > 9000 

在查看表映射后,我不确定这是否适用于 Hive。 . .如何映射可能存在或不存在的列。 . .更不用说典型样本中大约有 2k-3k 个可查询值。

因此,我向专家提出的问题:

  • Hive 能否根据它遇到的数据构建动态模式?
  • 如何构建包含约 3k 列的 Hive 表?
  • 有没有更好的方法?

一如既往地受到赞赏。

最佳答案

好了——废话少说,我现在可以回答我自己的问题了。

  • Hive 能否根据它遇到的数据构建动态模式? 答:不可以。但是,有一个优秀的工具可以做到这一点。 q.v., inf.

  • 如何构建包含约 3K 列的 Hive 表 答:同上

  • 有没有更好的方法? A:不是我发现的;但是,在一些帮助下,这并不太难。

首先,感谢 http://thornydev.blogspot.com/2013/07/querying-json-records-via-hive.html 的 Michael Peterson,他的博文是解决所有这些问题的立足点。

如果您刚开始使用 Hive,一定要检查一下。

现在,Hive 无法本地导入 JSON 文档并从中推断出模式。 . .然而,Michael Peterson 已经开发了这样的工具:https://github.com/midpeter444/hive-json-schema

一些注意事项: * 不处理空数组和结构,因此删除(或填充)它们。否则,{ "something": {} } {"somethingelse": []} 之类的东西会抛出错误。

  • 如果任何字段的名称为“function”,则必须在执行 CREATE TABLE 语句之前重新命名。例如,以下代码会引发错误:1{ "someThing": { "thisIsOK": "true", "function": "thatThrowsAnError"} }`

据推测,这是因为 "function" 是一个 Hive 关键字。

  • 而且,对于一般的动态架构,即使架构有效,我也没有找到处理嵌套前导下划线名称的方法:{ "somethings": { "_someVal": "123", "otherVal": "456"} } 将失败。

  • 对于常见的 MongoDB“ID”字段,这是可映射的,添加了以下内容:with serdeproperties("mapping.id"= "_id"),看起来是类似于宏替换。

JSON 的序列化/反序列化可以通过添加以下内容使用 https://github.com/rcongiu/Hive-JSON-Serde 实现:ROW FORMAT SERDE 'org.openx.data.jsonserde.JsonSerDe'

注意,JsonSerDe JAR 必须已添加到 .hiverc 或“添加 jar”到 Hive 中才能使用。
因此,模式:

CREATE TABLE samplesJSON 
    ( id string,
       . . . rest of huge schema . . . . )
ROW FORMAT SERDE 'org.openx.data.jsonserde.JsonSerDe'
WITH serdeproperties("mapping.id" = "_id");

可以使用如下命令将 JSON 数据加载到表中:

LOAD DATA LOCAL INPATH '/tmp/samples.json' OVERWRITE INTO TABLE samplesJSON;

最后,查询实际上是直观直接的。使用原始问题中的上述示例:

hive> select id, somescanner.parser.headers.vaddr from samplesjson;
OK
id    vaddr
119   [4096,53248,57344]

关于mongodb - 动态模式的 Hive 表创建,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/24643111/

有关mongodb - 动态模式的 Hive 表创建的更多相关文章

  1. ruby - 如何在 Ruby 中顺序创建 PI - 2

    出于纯粹的兴趣,我很好奇如何按顺序创建PI,而不是在过程结果之后生成数字,而是让数字在过程本身生成时显示。如果是这种情况,那么数字可以自行产生,我可以对以前看到的数字实现垃圾收集,从而创建一个无限系列。结果只是在Pi系列之后每秒生成一个数字。这是我通过互联网筛选的结果:这是流行的计算机友好算法,类机器算法:defarccot(x,unity)xpow=unity/xn=1sign=1sum=0loopdoterm=xpow/nbreakifterm==0sum+=sign*(xpow/n)xpow/=x*xn+=2sign=-signendsumenddefcalc_pi(digits

  2. python - 如何使用 Ruby 或 Python 创建一系列高音调和低音调的蜂鸣声? - 2

    关闭。这个问题是opinion-based.它目前不接受答案。想要改进这个问题?更新问题,以便editingthispost可以用事实和引用来回答它.关闭4年前。Improvethisquestion我想在固定时间创建一系列低音和高音调的哔哔声。例如:在150毫秒时发出高音调的蜂鸣声在151毫秒时发出低音调的蜂鸣声200毫秒时发出低音调的蜂鸣声250毫秒的高音调蜂鸣声有没有办法在Ruby或Python中做到这一点?我真的不在乎输出编码是什么(.wav、.mp3、.ogg等等),但我确实想创建一个输出文件。

  3. ruby-on-rails - Rails - 子类化模型的设计模式是什么? - 2

    我有一个模型:classItem项目有一个属性“商店”基于存储的值,我希望Item对象对特定方法具有不同的行为。Rails中是否有针对此的通用设计模式?如果方法中没有大的if-else语句,这是如何干净利落地完成的? 最佳答案 通常通过Single-TableInheritance. 关于ruby-on-rails-Rails-子类化模型的设计模式是什么?,我们在StackOverflow上找到一个类似的问题: https://stackoverflow.co

  4. ruby - 解析 RDFa、微数据等的最佳方式是什么,使用统一的模式/词汇(例如 schema.org)存储和显示信息 - 2

    我主要使用Ruby来执行此操作,但到目前为止我的攻击计划如下:使用gemsrdf、rdf-rdfa和rdf-microdata或mida来解析给定任何URI的数据。我认为最好映射到像schema.org这样的统一模式,例如使用这个yaml文件,它试图描述数据词汇表和opengraph到schema.org之间的转换:#SchemaXtoschema.orgconversion#data-vocabularyDV:name:namestreet-address:streetAddressregion:addressRegionlocality:addressLocalityphoto:i

  5. ruby - 使用 Vim Rails,您可以创建一个新的迁移文件并一次性打开它吗? - 2

    使用带有Rails插件的vim,您可以创建一个迁移文件,然后一次性打开该文件吗?textmate也可以这样吗? 最佳答案 你可以使用rails.vim然后做类似的事情::Rgeneratemigratonadd_foo_to_bar插件将打开迁移生成的文件,这正是您想要的。我不能代表textmate。 关于ruby-使用VimRails,您可以创建一个新的迁移文件并一次性打开它吗?,我们在StackOverflow上找到一个类似的问题: https://sta

  6. ruby-on-rails - 无法使用 Rails 3.2 创建插件? - 2

    我对最新版本的Rails有疑问。我创建了一个新应用程序(railsnewMyProject),但我没有脚本/生成,只有脚本/rails,当我输入ruby./script/railsgeneratepluginmy_plugin"Couldnotfindgeneratorplugin.".你知道如何生成插件模板吗?没有这个命令可以创建插件吗?PS:我正在使用Rails3.2.1和ruby​​1.8.7[universal-darwin11.0] 最佳答案 随着Rails3.2.0的发布,插件生成器已经被移除。查看变更日志here.现在

  7. ruby - 如何在续集中重新加载表模式? - 2

    鉴于我有以下迁移:Sequel.migrationdoupdoalter_table:usersdoadd_column:is_admin,:default=>falseend#SequelrunsaDESCRIBEtablestatement,whenthemodelisloaded.#Atthispoint,itdoesnotknowthatusershaveais_adminflag.#Soitfails.@user=User.find(:email=>"admin@fancy-startup.example")@user.is_admin=true@user.save!ende

  8. ruby - 如何使用 RSpec::Core::RakeTask 创建 RSpec Rake 任务? - 2

    如何使用RSpec::Core::RakeTask初始化RSpecRake任务?require'rspec/core/rake_task'RSpec::Core::RakeTask.newdo|t|#whatdoIputinhere?endInitialize函数记录在http://rubydoc.info/github/rspec/rspec-core/RSpec/Core/RakeTask#initialize-instance_method没有很好的记录;它只是说:-(RakeTask)initialize(*args,&task_block)AnewinstanceofRake

  9. ruby - 为什么 SecureRandom.uuid 创建一个唯一的字符串? - 2

    关闭。这个问题需要detailsorclarity.它目前不接受答案。想改进这个问题吗?通过editingthispost添加细节并澄清问题.关闭8年前。Improvethisquestion为什么SecureRandom.uuid创建一个唯一的字符串?SecureRandom.uuid#=>"35cb4e30-54e1-49f9-b5ce-4134799eb2c0"SecureRandom.uuid方法创建的字符串从不重复?

  10. ruby - 有人可以帮助解释类创建的 post_initialize 回调吗 (Sandi Metz) - 2

    我正在阅读SandiMetz的POODR,并且遇到了一个我不太了解的编码原则。这是代码:classBicycleattr_reader:size,:chain,:tire_sizedefinitialize(args={})@size=args[:size]||1@chain=args[:chain]||2@tire_size=args[:tire_size]||3post_initialize(args)endendclassMountainBike此代码将为其各自的属性输出1,2,3,4,5。我不明白的是查找方法。当一辆山地自行车被实例化时,因为它没有自己的initialize方法

随机推荐